往下拉回到首頁
用 -DGGML_BACKEND_DL=ON 同時運行 CUDA + ROCm!

用 -DGGML_BACKEND_DL=ON 同時運行 CUDA + ROCm!

Run CUDA + ROCm simultaneously with -DGGML_BACKEND_DL=ON!

花了不少功夫終於搞定了!現在可以同時用 CUDA 和 ROCm 跑大型語言模型(像是 Minimax 2.7 Q4),完全繞過 Vulkan。整個設定把全部 63 層都卸載到 GPU,CUDA 處理 83.6GB、ROCm 處理 40.3GB、CPU 處理剩下的。最大的好處是 prefill 速度快到不行。在 Windows 上的話,就是清空 build 資料夾,然後用 CMake 搭 Ninja 產生器指向你的 AMD ROC 安裝位置。