아래로 당겨서 돌아가기
추측 디코딩이 모델마다 665% 빨라지거나 40%만 빨라지는 이유가 뭘까?

추측 디코딩이 모델마다 665% 빨라지거나 40%만 빨라지는 이유가 뭘까?

Why does speculative decoding give wildly different speed boosts across AI models? (665% for some, barely 40% for others)

llama.cpp에서 추측 디코딩(여러 토큰을 한 번에 예측해서 속도를 올리는 기술)을 테스트하는 사람이 있는데, 결과가 완전 다르게 나왔대요. 같은 설정인데 Gemma 4 31b는 2배 빨라지고(100% 향상), Qwen 3.6은 40%만 빨라지는데, Devstrall small은 665%나 빨라진다고? 의문: 이 모델들의 뭐가 다르길래 추측 디코딩 효과가 이렇게 차이 나는 거야? 나중에 반복 페널티랑 스펙 타입을 조정하니까 Qwen도 빨라졌다고 해요. 같은 최적화 기법인데 모델마다 효과가 천차만별인 이유를 파고드는 얘기네요.