往下拉回到首頁
只有 8GB 顯存也能跑 Qwen3.6 35B?我的成功設定分享——還有個 max_tokens 的坑要小心

只有 8GB 顯存也能跑 Qwen3.6 35B?我的成功設定分享——還有個 max_tokens 的坑要小心

Running Qwen3.6 35B MoE on Just 8GB VRAM — Here's the Config That Actually Works (Plus a Sneaky max_tokens Bug I Found)

欸你知道嗎,我最近在筆電上(就一張 RTX 4060,8GB 顯存而已)成功跑起了 Qwen3.6-35B-A3B 這個大模型。說真的有點扯,我想把這個設定分享給大家。不過先說好,這不是拿來跟 AI 聊天的那種用法,我是把它當作一個編程助手,放在一個更大的 AI 工作流程裡面,所以有些做法是針對這個特定情況的。最扯的是我後來發現的一個 bug:無限思考模式(thinking)沒有直接當機,反而是偷偷把我整個 max_tokens 的預算吃光光,害我一開始還以為是硬體不夠。後來關掉思考功能就解決了,但其實有更聰明的方法是設定每個 token 的限制。如果你也想在有限的電腦上跑強大的 AI 模型來做特定工作,這篇應該能救你好幾小時的除錯時間,真的值得看一下。