아래로 당겨서 돌아가기
-DGGML_BACKEND_DL=ON으로 CUDA + ROCm 동시 실행하기!

-DGGML_BACKEND_DL=ON으로 CUDA + ROCm 동시 실행하기!

Run CUDA + ROCm simultaneously with -DGGML_BACKEND_DL=ON!

많은 시간을 투자한 끝에 드디어 Minimax 2.7 Q4 같은 대형 언어 모델을 CUDA와 ROCm으로 동시에 실행할 수 있게 되었습니다. Vulkan을 완전히 우회합니다. 설정에서는 63개 레이어를 모두 GPU로 오프로드하며, CUDA가 83.6GB, ROCm이 40.3GB, CPU가 나머지를 처리합니다. 가장 큰 장점은 prefill 성능이 극적으로 향상된다는 것입니다. Windows에서는 build 디렉토리를 지우고 CMake와 Ninja 생성기를 사용하여 AMD ROC 설치를 지정하면 됩니다.