아래로 당겨서 돌아가기
16GB M3 맥북 에어에서 Qwen 3.5 35B를 8.9 TPS로 구동하기

16GB M3 맥북 에어에서 Qwen 3.5 35B를 8.9 TPS로 구동하기

Running Qwen 3.5 35B on a 16GB M3 MacBook Air at 8.9 TPS - Here's How

16GB M3 맥북 에어에서 메모리 매핑(mmap) 기술을 사용해 거대한 언어모델인 Qwen 3.5 35B를 성공적으로 실행했습니다. 모델이 RAM보다 훨씬 크다는 점을 고려하면 초당 8.9 토큰이라는 속도는 꽤 괜찮은 결과입니다. 비결이 뭘까요? GGUF 양자화로 모델을 압축하고, mmap으로 디스크와 메모리 간 데이터 교환을 효율적으로 처리하는 것입니다. Hugging Face에서 모델을 다운로드하는 것부터 시작해서 구체적인 설정 단계를 안내해드리겠습니다. 군더더기 없이 맥에서 강력한 AI를 로컬로 실행하고 싶은 사람들을 위한 실용적인 가이드입니다.