
OpenAI 直播活動
OpenAI 將舉辦一場直播活動。在直播期間將揭露具體的公告、產品發布或示範內容。
上一次 OpenAI 突然搞直播,他們直接丟出 GPT-4 Turbo,然後一夜之間改掉所有定價

Anthropic 的 Opus 4.7 在 LLM 辯論基準測試(LLM Debate Benchmark)上創造了驚人的成績——完全沒有輸過。這個模型參加了 55 場已完成的辯論(每個議題都要正反兩方都辯),累積了 51 場勝利、4 場平手,以及零場敗北。領先前一代冠軍 Sonnet 4.6 達 106 分。 最有趣的地方是:Opus 4.7 不只是贏得辯論——它透過找出每場辯論的核心問題(所謂的「樞紐」),然後把整個討論都圍繞著這個點打轉。這樣就能強迫對手按照 Opus 的邏輯來辯論,這是個相當聰明的修辭策略。 這個基準測試使用三個模型組成的評審團來評分每場辯論,而且他們刻意避免讓同一家族的模型擔任評審(比如不讓 Opus 評審 Opus 的辯論)。完整的辯論稿、模型資料和詳細比較都在 GitHub 上,如果你想看這些 AI 辯論的實際內容,可以去查看。