아래로 당겨서 돌아가기
Qwen3.6 35B MoE를 8GB VRAM에서 돌리기——실제로 작동하는 llama-server 설정 + max_tokens 함정

Qwen3.6 35B MoE를 8GB VRAM에서 돌리기——실제로 작동하는 llama-server 설정 + max_tokens 함정

Running Qwen3.6 35B MoE on Just 8GB VRAM — Here's the Config That Actually Works (Plus a Sneaky max_tokens Bug I Found)

노트북 RTX 4060(8GB VRAM)에서 Qwen3.6-35B-A3B를 성공적으로 실행했으니 설정 방법을 공유하려고 합니다. 다만 이건 일반적인 채팅용이 아니라 더 큰 AI 파이프라인 안에서 코딩 서브에이전트로 사용하고 있어서, 일부 설정은 그 특정 용도에 맞춰져 있습니다. 가장 골치 아팠던 부분은 무제한 사고 모드(thinking)가 충돌하지 않으면서도 조용히 max_tokens 예산 전체를 소비하고 있었다는 것입니다. 사고 기능을 비활성화하면 해결되지만, 실제로는 토큰별 제한을 사용하는 더 똑똑한 방법도 있습니다. 제한된 하드웨어에서 특정 작업용 강력한 모델을 돌리려면 이 글이 몇 시간의 디버깅 시간을 절약해줄 겁니다.