下に引いて戻る
TurboQuant フォークの Qwen3.6 で推測デコーディングが静かに機能停止——修正 PR 提出

TurboQuant フォークの Qwen3.6 で推測デコーディングが静かに機能停止——修正 PR 提出

Speculative Decoding Silently Broken for Qwen3.6 on TurboQuant Fork — PR to Fix

TurboQuant フォークで Qwen3.6-35B-A3B を実行していて推測デコーディングを試した場合、実は何もしていなかったんです。サーバーはエラーメッセージも出さずに通常のデコーディングにフォールバックしていました。推測デコーディングの基本的な考え方はこうです:小さなモデル(Qwen3.5-0.8B など)と大きなモデルを並行実行します。小さいモデルが次のトークン列を高速に予測し、大きなモデルがそれらの予測をまとめてチェックします。大きなモデルが同意した部分は保持し、拒否した部分は再生成します。つまり、大きなモデルが十分高速なら、無料で大幅な速度向上が得られるわけです。