
OpenAI ライブストリーム
OpenAIがライブストリーム配信イベントを開催します。放送中に具体的な発表、新製品発表、またはデモンストレーションが明かされる予定です。
OpenAIが前回予告なしのライブストリームをやった時、GPT-4 Turboをドロップして、一晩で価格設定を完全に変えました

開発者がメモリ制限のあるGPU環境でDFlash推測デコーディング技術の実装に成功しました。わずか8GBのVRAMを搭載したRTX 2080 SUPERを使用して、35Bパラメータの Qwen3.5-35B-A3Bモデル(Q5_K_Mに量子化、約24.44GB)を実行し、より小さいQ4_K_Mドラフトモデルで推論を高速化しています。CUDA バックエンドを採用し、llama.cpp リポジトリのDFlash PRに基づいてテストされており、消費者向けハードウェアでも適切な量子化とモデル選択により、高度な推論最適化技術が実現可能であることを実証しています。