下に引いて戻る
新しいLLM位置バイアスベンチマーク:AIは答えの順序が変わると判断を変えるのか?

新しいLLM位置バイアスベンチマーク:AIは答えの順序が変わると判断を変えるのか?

New LLM Position Bias Benchmark: Does an AI Judge Change Its Mind When You Swap the Answers?

研究者たちが興味深い実験を行いました。同じストーリーの2つのわずかに異なるバージョンをAIモデルに見せて、順序を逆にして再度見せ、これらの「AI判事」が判断を変えるかどうかを調べたのです。結果は懸念すべきものです。中央値のモデルは45%のケースで矛盾した判断をし、GPT-5.4に至っては66%です。さらに悪いことに、これらのモデルは先に表示されたオプションをより頻繁に選ぶだけでなく、それにより高いスコアを与えます。平均して+0.26ポイント(7点満点)の加点です。これはAIの根本的な問題を露呈しています。実は公平に推論していないのです。単に最初に見たものに盲目的に偏っているだけなのです。完全なベンチマークデータ、グラフ、生データはGitHubで利用可能です。