下に引いて戻る
Opus 4.7が LLM 辯論ベンチマークで無敗優勝:51勝0敗で Sonnet 4.6 を 106 ポイント上回る

Opus 4.7が LLM 辯論ベンチマークで無敗優勝:51勝0敗で Sonnet 4.6 を 106 ポイント上回る

Opus 4.7 dominates LLM Debate Benchmark with perfect record: 51 wins, 0 losses, crushing Sonnet 4.6 by 106 points

Anthropic の Opus 4.7 が LLM 辯論ベンチマークで驚異的な成績を達成しました。55の完了した辯論に参加し、51勝4分0敗という完璧な記録を樹立。前代チャンピオンの Sonnet 4.6 を 106ポイント上回っています。 注目すべきは、Opus 4.7 の勝ち方です。単に議論に勝つだけでなく、各辯論の「要点」を見つけ出し、そこに議論全体を集約させることで、相手を自分のペースで議論させるという戦略を使っています。これは非常に巧妙な修辞戦術です。 各辯論は3つのモデルで構成される評審パネルによって判定されます。利益相反を避けるため、評審は辯者と同じファミリーのモデルからは選ばれません。完全な辯論記録、モデルプロファイル、詳細な比較は GitHub で公開されており、AI がどのように議論を展開するのかを実際に確認できます。