往下拉回到首頁
Qwen3.6 35B MoE 只用 8GB 顯存就能跑——實測 llama-server 設定 + 我踩到的 max_tokens 陷阱

Qwen3.6 35B MoE 只用 8GB 顯存就能跑——實測 llama-server 設定 + 我踩到的 max_tokens 陷阱

Running Qwen3.6 35B MoE on Just 8GB VRAM — Here's the Config That Actually Works (Plus a Sneaky max_tokens Bug I Found)

我在筆電 RTX 4060(8GB 顯存)上成功跑起了 Qwen3.6-35B-A3B,想分享一下設定方法。先說清楚,這不是拿來聊天的,我是把它當作編程子代理(coding subagent)放在一個更大的 AI 流程裡面,所以有些選擇是針對這個特定用途的。最扯的是我發現的那個 bug:無限思考模式(unlimited thinking)沒有直接當機,而是偷偷把整個 max_tokens 預算吃光光。關掉思考模式就解決了,但其實有更聰明的做法是用每個 token 的限制。如果你也想在有限的硬體上跑強大的模型來做特定任務,這篇應該能救你好幾小時的除錯時間。