往下拉回到首頁
Qwen3.6 在 TurboQuant 分支上的推測解碼功能暗中失效——已提交修復 PR

Qwen3.6 在 TurboQuant 分支上的推測解碼功能暗中失效——已提交修復 PR

Speculative Decoding Silently Broken for Qwen3.6 on TurboQuant Fork — PR to Fix

如果你在 TurboQuant 分支上執行 Qwen3.6-35B-A3B 並嘗試使用推測解碼(speculative decoding),它其實一直在暗中失效。伺服器會無聲地回退到普通解碼模式,完全不會拋出任何錯誤訊息。簡單來說推測解碼的原理是這樣的:你同時執行一個小模型(比如 Qwen3.5-0.8B)和你的大模型。小模型快速預測接下來的一串 token,然後大模型在一次通過中檢查所有預測。大模型同意的部分就保留,不同意的部分就重新生成。所以如果你的大模型夠快,就能免費獲得顯著的速度提升。