往下拉回到首頁
有人在 llama.cpp 上測試過 Gemma 4 31B IT 或 Qwen 3.5 27B 的推測解碼嗎?

有人在 llama.cpp 上測試過 Gemma 4 31B IT 或 Qwen 3.5 27B 的推測解碼嗎?

Has anyone tested speculative decoding in llama.cpp with Gemma 4 31B IT or Qwen 3.5 27B?

一位開發者在詢問社群是否有人用 llama.cpp 測試過推測解碼(speculative decoding)這個加速技術。他想知道用 Gemma 4 31B IT 或 Qwen 3.5 27B 這兩個大型語言模型時,哪個較小的草稿模型(draft model)搭配效果最好,以及實際上能不能真的加快生成速度。他也提到不確定 Qwen 3.5 在 llama.cpp 上的推測解碼支援狀況如何。

關鍵字

speculative decodingdraft modelsinference optimizationllama.cppGemma 4Qwen 3.5performance