
OpenAI ライブストリーム
OpenAIがライブストリーム配信イベントを開催します。放送中に具体的な発表、新製品発表、またはデモンストレーションが明かされる予定です。
OpenAIが前回予告なしのライブストリームをやった時、GPT-4 Turboをドロップして、一晩で価格設定を完全に変えました

TurboQuant フォークで Qwen3.6-35B-A3B を実行していて推測デコーディングを試した場合、実は何もしていなかったんです。サーバーはエラーメッセージも出さずに通常のデコーディングにフォールバックしていました。推測デコーディングの基本的な考え方はこうです:小さなモデル(Qwen3.5-0.8B など)と大きなモデルを並行実行します。小さいモデルが次のトークン列を高速に予測し、大きなモデルがそれらの予測をまとめてチェックします。大きなモデルが同意した部分は保持し、拒否した部分は再生成します。つまり、大きなモデルが十分高速なら、無料で大幅な速度向上が得られるわけです。