
OpenAI 直播活動
OpenAI 將舉辦一場直播活動。在直播期間將揭露具體的公告、產品發布或示範內容。
上一次 OpenAI 突然搞直播,他們直接丟出 GPT-4 Turbo,然後一夜之間改掉所有定價

如果你在 TurboQuant 分支上執行 Qwen3.6-35B-A3B 並嘗試使用推測解碼(speculative decoding),它其實一直在暗中失效。伺服器會無聲地回退到普通解碼模式,完全不會拋出任何錯誤訊息。簡單來說推測解碼的原理是這樣的:你同時執行一個小模型(比如 Qwen3.5-0.8B)和你的大模型。小模型快速預測接下來的一串 token,然後大模型在一次通過中檢查所有預測。大模型同意的部分就保留,不同意的部分就重新生成。所以如果你的大模型夠快,就能免費獲得顯著的速度提升。