往下拉回到首頁
AI 判官有夠不公平!同一個故事改個順序就改口,有些模型甚至 66% 的時候都會翻臉

AI 判官有夠不公平!同一個故事改個順序就改口,有些模型甚至 66% 的時候都會翻臉

New LLM Position Bias Benchmark: Does an AI Judge Change Its Mind When You Swap the Answers?

欸你知道嗎,有人做了一個實驗來測試 AI 是不是真的在認真思考,還是只是看誰先出現就選誰。他們拿同一個故事,改一改細節,然後分別用兩個不同的順序給 AI 看,看看 AI 會不會改口。結果超扯——一般的 AI 模型有 45% 的機率會自相矛盾,而 GPT-5.4 根本爛到不行,66% 都會改口。更誇張的是,這些 AI 不只是比較常選先出現的選項,它們還會給先出現的選項打更高分,平均多加 0.26 分(滿分 7 分)。簡單來說就是,這些 AI 根本沒在公平判斷,它們就是盲目地偏好最先看到的東西。說真的有點扯,因為這代表 AI 其實沒有在真正思考,只是在玩數字遊戲。如果你有在用 AI 來做重要決定,這個研究結果應該會讓你有點擔心。GitHub 上有完整的數據和圖表,有興趣的話可以自己看看。