下に引いて戻る
Llama.cpp のオートフィット機能が予想以上に優秀だった

Llama.cpp のオートフィット機能が予想以上に優秀だった

Llama.cpp's auto fit works much better than I expected

32GBのVRAMがあれば、実行できる最大モデルは20GB程度(Qwen3.5 27B Q4やQ6など)だと思い込んでいました。すべてVRAMに収まらないと2 t/sまで落ちるものだと考えていたんです。ところが大間違いでした。llama.cppでQwen3.6 Q8を256kコンテキストで試してみたところ、`--fit`オプションをオンにすると、モデルの重みだけで既にVRAMを超えているのに、Oculink経由で接続したRTX 5090で57 t/sが出ました!これはもう魔法です。私と同じように「すべてVRAMに収まらなきゃダメ」と思い込んでいる人は、ぜひこの機能を試してみてください。