아래로 당겨서 돌아가기
RTX 2080 SUPER 8GB에서 Qwen3.5-35B-A3B 모델로 DFlash 추측 디코딩 성공

RTX 2080 SUPER 8GB에서 Qwen3.5-35B-A3B 모델로 DFlash 추측 디코딩 성공

Got DFlash speculative decoding working on Qwen3.5-35B-A3B with an RTX 2080 SUPER 8GB

개발자가 메모리가 제한된 GPU 환경에서 DFlash 추측 디코딩(speculative decoding) 기술 구현에 성공했습니다. 단 8GB의 VRAM을 가진 RTX 2080 SUPER를 사용하여 35B 파라미터의 Qwen3.5-35B-A3B 모델(Q5_K_M으로 양자화, 약 24.44GB)을 실행하고, 더 작은 Q4_K_M 드래프트 모델로 추론 속도를 높였습니다. CUDA 백엔드를 사용하며 llama.cpp 저장소의 DFlash PR을 기반으로 테스트되었으며, 소비자급 하드웨어에서도 적절한 양자화와 모델 선택을 통해 고급 추론 최적화 기술이 가능함을 보여줍니다.