下に引いて戻る
llama.cpp で Gemma 4 31B IT や Qwen 3.5 27B の推測デコーディングを試した人いますか?

llama.cpp で Gemma 4 31B IT や Qwen 3.5 27B の推測デコーディングを試した人いますか?

Has anyone tested speculative decoding in llama.cpp with Gemma 4 31B IT or Qwen 3.5 27B?

開発者が、llama.cpp で推測デコーディング(推測復号化)という高速化技術を使って、Gemma 4 31B IT と Qwen 3.5 27B という2つの大規模言語モデルをテストした経験について、コミュニティに質問しています。どのサイズの小さいドラフトモデルが最適で、実際にスピードアップが得られたかを知りたいとのこと。Qwen 3.5 が llama.cpp の推測デコーディングで本当に機能するのか不確かな点もあるようです。

キーワード

speculative decodingdraft modelsinference optimizationllama.cppGemma 4Qwen 3.5performance