아래로 당겨서 돌아가기
RTX 5090에서 Qwen3.5-27B를 vLLM으로 실행, 77 tps 달성

RTX 5090에서 Qwen3.5-27B를 vLLM으로 실행, 77 tps 달성

Qwen3.5-27B on RTX 5090 served via vLLM @ 77 tps

이번 달 Cursor와 Zai 구독 한도를 다 써버려서 로컬 대규모 언어 모델(LLM)을 직접 구축하기로 결정했습니다. RTX 5090에서 Qwen3.5 27B를 실행한 결과 예상보다 훨씬 좋은 성능을 얻었고, 상당히 우수한 초당 추론 횟수(tps)를 달성했습니다. 컨텍스트 윈도우는 218k로 설정할 수 있으며, 2개의 동시 세션도 실행 가능하지만 세션당 속도는 예상대로 감소합니다. vLLM 0.19에서는 256k의 전체 컨텍스트 윈도우로 작동시킬 수 없었지만, 0.17에서는 작동합니다. 다만 속도가 저하되는데, 0.17에는 새 버전의 최적화 기능이 많이 포함되어 있지 않기 때문입니다.