下に引いて戻る
Qwen3.6 35B MoEを8GBのVRAMで動かす方法——実際に動作するllama-serverの設定+max_tokensの落とし穴

Qwen3.6 35B MoEを8GBのVRAMで動かす方法——実際に動作するllama-serverの設定+max_tokensの落とし穴

Running Qwen3.6 35B MoE on Just 8GB VRAM — Here's the Config That Actually Works (Plus a Sneaky max_tokens Bug I Found)

ノートパソコンのRTX 4060(8GB VRAM)でQwen3.6-35B-A3Bを動かすことに成功したので、その設定方法をシェアしたいと思います。ただし、これはカジュアルなチャット用ではなく、より大きなAIパイプラインの中でコーディング用のサブエージェントとして使っているので、設定の一部はそのユースケースに特化しています。一番厄介だったのは、無制限の思考モード(thinking)がクラッシュせずに静かにmax_tokensの予算全体を消費していたこと。思考機能を無効にしたら解決しましたが、実はトークンごとの制限を使うというもっとスマートな方法もあります。限られたハードウェアで強力なモデルを特定のタスク用に動かしたいなら、この記事は何時間ものデバッグ時間を節約できるはずです。