
OpenAI ライブストリーム
OpenAIがライブストリーム配信イベントを開催します。放送中に具体的な発表、新製品発表、またはデモンストレーションが明かされる予定です。
OpenAIが前回予告なしのライブストリームをやった時、GPT-4 Turboをドロップして、一晩で価格設定を完全に変えました

llama.cpp で推測デコーディング(複数のトークンを一度に予測して高速化する技術)をテストしている人がいるんですが、結果がめちゃくちゃ違うんです。同じ設定なのに、Gemma 4 31b は2倍速(100%向上)、Qwen 3.6 は40%しか速くならない、なのに Devstrall small は665%も速くなっちゃう。疑問:これらのモデルの何が違うから、推測デコーディングの効果がこんなに変わるの?その後、リピート・ペナルティとスペック・タイプを調整することで Qwen も速くなることを発見。同じ最適化テクニックなのに、モデルによってこんなに効果が違う理由を探る深い話です。