아래로 당겨서 돌아가기
Llama.cpp의 자동 최적화 기능이 생각보다 훨씬 잘 작동한다

Llama.cpp의 자동 최적화 기능이 생각보다 훨씬 잘 작동한다

Llama.cpp's auto fit works much better than I expected

32GB VRAM이면 최대 20GB 정도의 모델만 실행할 수 있다고 생각했어요. Qwen3.5 27B Q4나 Q6 같은 거 말이에요. 모든 게 VRAM에 들어가야 하고, 아니면 2 t/s 정도로 떨어질 거라고 생각했죠. 근데 완전 틀렸어요. llama.cpp에서 Qwen3.6 Q8을 256k 컨텍스트로 테스트해봤는데, `--fit` 옵션을 켜니까 모델 가중치만 해도 제 VRAM보다 크고, Oculink로 연결된 RTX 5090인데도 57 t/s가 나왔어요! 진짜 마법 같아요. 저처럼 '모든 게 VRAM에 들어가야 한다'고 생각하고 있던 분들이라면 꼭 이 기능을 시도해보세요.