往下拉回到首頁
推測解碼為什麼在不同 AI 模型上快 665% 或慢 40%?差異在哪裡

推測解碼為什麼在不同 AI 模型上快 665% 或慢 40%?差異在哪裡

Why does speculative decoding give wildly different speed boosts across AI models? (665% for some, barely 40% for others)

有人在 llama.cpp 測試推測解碼(speculative decoding)——一種一次預測多個詞元來加速的技術——結果卻得到超詭異的結果。用同樣的設定,Gemma 4 31b 快了一倍(100% 提升),Qwen 3.6 只快了 40%,但 Devstrall small 竟然快了 665%。問題來了:這些模型到底有什麼差異,才會讓推測解碼的效果差這麼多?他們後來發現調整重複懲罰(repeat penalty)和推測類型可以讓 Qwen 追上來。這是在探討為什麼同一個優化技巧對不同模型的效果天差地遠。