往下拉回到首頁
天啊,Llama.cpp 這個自動調整功能根本超強,我之前完全看走眼

天啊,Llama.cpp 這個自動調整功能根本超強,我之前完全看走眼

Llama.cpp's auto fit works much better than I expected

欸你知道嗎,我之前一直以為自己有 32GB 顯存就只能跑 20GB 左右的 AI 模型,像什麼 Qwen3.5 27B 之類的,而且還要調整參數(Q4、Q6)才行。我還傻傻地以為一定要把整個模型塞進顯存裡,不然速度就會慢到爆炸,大概只有 2 t/s 這樣。結果我最近用 llama.cpp 試了一個新版本的 Qwen3.6 Q8,打開 `--fit` 這個選項,結果超扯的——模型本身的大小根本超過我的顯存,我的顯卡還是透過 Oculink 這種外接方式連接的,竟然還能跑出 57 t/s!根本是魔法啦,說真的有點不敢相信。如果你也跟我一樣被卡在「顯存不夠就沒救」這個死胡同裡,真的一定要試試看,會改變你對 AI 模型運行的整個認知。