
OpenAI ライブストリーム
OpenAIがライブストリーム配信イベントを開催します。放送中に具体的な発表、新製品発表、またはデモンストレーションが明かされる予定です。
OpenAIが前回予告なしのライブストリームをやった時、GPT-4 Turboをドロップして、一晩で価格設定を完全に変えました

32GBのVRAMがあれば、実行できる最大モデルは20GB程度(Qwen3.5 27B Q4やQ6など)だと思い込んでいました。すべてVRAMに収まらないと2 t/sまで落ちるものだと考えていたんです。ところが大間違いでした。llama.cppでQwen3.6 Q8を256kコンテキストで試してみたところ、`--fit`オプションをオンにすると、モデルの重みだけで既にVRAMを超えているのに、Oculink経由で接続したRTX 5090で57 t/sが出ました!これはもう魔法です。私と同じように「すべてVRAMに収まらなきゃダメ」と思い込んでいる人は、ぜひこの機能を試してみてください。