往下拉回到首頁
Llama.cpp 的自動適配功能遠比我想像的強大

Llama.cpp 的自動適配功能遠比我想像的強大

Llama.cpp's auto fit works much better than I expected

我一直以為 32GB 顯存最多只能跑 20GB 左右的模型,像是 Qwen3.5 27B Q4 或 Q6。我還以為一切都得塞進顯存裡,否則速度就會掉到 2 t/s。結果我大錯特錯了。我剛用 llama.cpp 測試了 Qwen3.6 Q8,開啟 256k 上下文,打開 `--fit` 選項,模型權重本身就已經超過我的顯存容量,而且我的 RTX 5090 還是透過 Oculink 連接,結果竟然還能跑出 57 t/s!根本是魔法啊。如果你也跟我一樣被困在「非得全部塞進顯存」的迷思裡,真的應該試試看這個功能。