아래로 당겨서 돌아가기
최강 머신: 32개 AMD MI50 32GB로 Kimi K2.6 구동, 9.7 t/s(출력) & 264 t/s(입력) 달성

최강 머신: 32개 AMD MI50 32GB로 Kimi K2.6 구동, 9.7 t/s(출력) & 264 t/s(입력) 달성

Final Monster: 32x AMD MI50 32GB Hits 9.7 t/s Output & 264 t/s Input with Kimi K2.6

누군가 궁극의 머신을 만들었습니다: 32개의 AMD MI50 GPU로 Kimi K2.6(오픈소스 대형언어모델)을 실행하여 초당 9.7개 토큰의 출력 속도와 초당 264개 토큰의 입력 속도를 달성했습니다. 이 시스템은 AMD GPU에 최적화된 커스텀 vLLM 포크를 사용하며, 유휴 상태에서 약 640W, 피크 추론 시 4.8kW를 소비합니다——기본적으로 소형 발전소 수준입니다. 솔직히 말해서? 정말 멋있지만, 태양광이나 데이터센터 폐열 같은 무료 전력이 없으면 경제적으로 전혀 맞지 않습니다. 이 설정은 16GPU 노드 2개를 10G 이더넷 케이블로 연결한 것으로, 전기료를 감수할 수 있다면 DIY로 초대형 추론 클러스터를 구축할 수 있음을 보여줍니다.