
OpenAI 直播活動
OpenAI 將舉辦一場直播活動。在直播期間將揭露具體的公告、產品發布或示範內容。
上一次 OpenAI 突然搞直播,他們直接丟出 GPT-4 Turbo,然後一夜之間改掉所有定價

研究人員做了一個有趣的實驗:他們給 AI 模型看同一個故事的兩個略微不同的版本,但順序相反,看看這些「AI 法官」是否會改變判斷。結果很令人擔憂——中位數模型在 45% 的情況下會自相矛盾,而 GPT-5.4 更是糟糕到 66%。更扯的是,這些模型不只是更常選擇先出現的選項,它們還會給先出現的選項打更高的分數,平均加分 +0.26(滿分 7 分)。這暴露了一個根本問題:這些 AI 其實沒有在公平地推理,它們只是盲目地偏好最先看到的東西。完整的基準測試數據、圖表和原始輸出都在 GitHub 上。