아래로 당겨서 돌아가기
llama.cpp에서 Gemma 4 31B IT나 Qwen 3.5 27B로 추측 디코딩을 테스트해본 사람 있나요?

llama.cpp에서 Gemma 4 31B IT나 Qwen 3.5 27B로 추측 디코딩을 테스트해본 사람 있나요?

Has anyone tested speculative decoding in llama.cpp with Gemma 4 31B IT or Qwen 3.5 27B?

개발자가 llama.cpp에서 추측 디코딩(speculative decoding)이라는 속도 향상 기법을 사용하여 Gemma 4 31B IT와 Qwen 3.5 27B 두 가지 대규모 언어 모델을 테스트한 경험이 있는지 커뮤니티에 묻고 있습니다. 어떤 크기의 작은 드래프트 모델이 가장 잘 작동하는지, 그리고 실제로 성능 향상을 경험했는지 알고 싶어 합니다. Qwen 3.5가 llama.cpp의 추측 디코딩에서 제대로 작동하는지에 대한 의문도 있는 것 같습니다.

키워드

speculative decodingdraft modelsinference optimizationllama.cppGemma 4Qwen 3.5performance