下に引いて戻る
推測デコーディングがモデルによって665%も速くなったり40%しか速くならないのはなぜ?

推測デコーディングがモデルによって665%も速くなったり40%しか速くならないのはなぜ?

Why does speculative decoding give wildly different speed boosts across AI models? (665% for some, barely 40% for others)

llama.cpp で推測デコーディング(複数のトークンを一度に予測して高速化する技術)をテストしている人がいるんですが、結果がめちゃくちゃ違うんです。同じ設定なのに、Gemma 4 31b は2倍速(100%向上)、Qwen 3.6 は40%しか速くならない、なのに Devstrall small は665%も速くなっちゃう。疑問:これらのモデルの何が違うから、推測デコーディングの効果がこんなに変わるの?その後、リピート・ペナルティとスペック・タイプを調整することで Qwen も速くなることを発見。同じ最適化テクニックなのに、モデルによってこんなに効果が違う理由を探る深い話です。