往下拉回到首頁
欸你知道嗎?Qwen3.6 在 TurboQuant 上的加速功能根本沒在動,但你不會發現

欸你知道嗎?Qwen3.6 在 TurboQuant 上的加速功能根本沒在動,但你不會發現

Speculative Decoding Silently Broken for Qwen3.6 on TurboQuant Fork — PR to Fix

如果你最近在用 TurboQuant 跑 Qwen3.6-35B-A3B,然後開啟了推測解碼(speculative decoding)這個功能,我跟你說啦,它根本沒在工作。伺服器就默默地回到普通模式,連個錯誤訊息都不給你,你根本不知道發生什麼事。簡單來說推測解碼就是這樣:你同時跑一個小模型(比如 Qwen3.5-0.8B)和你的大模型,小模型像個助手一樣快速地猜下一堆文字,然後大模型一次檢查所有猜測——大模型同意的就用,不同意的就重新生成。這樣的話,如果大模型夠快,你就能白白得到超快的速度。結果現在這個功能在 TurboQuant 上根本沒用,有人已經提 PR 要修了。