
OpenAI 直播活動
OpenAI 將舉辦一場直播活動。在直播期間將揭露具體的公告、產品發布或示範內容。
上一次 OpenAI 突然搞直播,他們直接丟出 GPT-4 Turbo,然後一夜之間改掉所有定價

研究人員比較了兩個相同的 12 億參數 AI 模型,兩者用同樣的資料訓練,只有一個關鍵差異:其中一個採用受預測編碼啟發的新訓練方法(包含精度加權增益和分層梯度縮放),另一個用標準訓練。詭異的地方來了——兩個模型的效能指標幾乎完全相同,但當 10 位評審(7 位人類 + 3 個 AI 系統)在不知道身份的情況下比較它們時,他們偏好新方法的比例達到 63.4%。這暗示新的訓練方法創造了某種有意義的東西,但標準指標完全看不出來。統計顯著性達到 p = 1.98 × 10⁻⁵,這絕對不是巧合。意涵?我們可能一直在用錯誤的方式衡量 AI 品質。