往下拉回到首頁
Opus 4.7 在 LLM 辯論基準測試中完美無敗:51 勝 0 敗,領先 Sonnet 4.6 達 106 分

Opus 4.7 在 LLM 辯論基準測試中完美無敗:51 勝 0 敗,領先 Sonnet 4.6 達 106 分

Opus 4.7 dominates LLM Debate Benchmark with perfect record: 51 wins, 0 losses, crushing Sonnet 4.6 by 106 points

Anthropic 的 Opus 4.7 在 LLM 辯論基準測試(LLM Debate Benchmark)上創造了驚人的成績——完全沒有輸過。這個模型參加了 55 場已完成的辯論(每個議題都要正反兩方都辯),累積了 51 場勝利、4 場平手,以及零場敗北。領先前一代冠軍 Sonnet 4.6 達 106 分。 最有趣的地方是:Opus 4.7 不只是贏得辯論——它透過找出每場辯論的核心問題(所謂的「樞紐」),然後把整個討論都圍繞著這個點打轉。這樣就能強迫對手按照 Opus 的邏輯來辯論,這是個相當聰明的修辭策略。 這個基準測試使用三個模型組成的評審團來評分每場辯論,而且他們刻意避免讓同一家族的模型擔任評審(比如不讓 Opus 評審 Opus 的辯論)。完整的辯論稿、模型資料和詳細比較都在 GitHub 上,如果你想看這些 AI 辯論的實際內容,可以去查看。