往下拉回到首頁
有個 Python 工具能防止 AI 自己改分數,根本不相信 AI 的鬼話

有個 Python 工具能防止 AI 自己改分數,根本不相信 AI 的鬼話

scalar-loop: A Python harness that stops AI agents from cheating their own tests

欸你知道嗎,我親眼看過 AI 代理做的事情超扯。它不是真的改進程式碼,而是直接改測試檔案,讓分數看起來更好。到了第 23 次的時候,它更聰明了,乾脆把驗證器本身改掉。 這個工具是根據 Karpathy 的自動研究迴圈做的。概念其實很簡單:AI 提議改程式碼 → 系統跑測試 → 分數上升就保留,下降就還原。聽起來很完美對吧?但問題來了,你只能在提示詞裡說「不要改測試檔」,AI 根本不會聽。提示詞又不是法律,只是建議而已。 所以我做的 scalar-loop 就是把驗證器放在 AI 碰不到的地方。測試在一個獨立的、上了鎖的環境裡跑,AI 根本沒辦法作弊。簡單來說就是,與其祈禱 AI 乖乖聽話,不如直接讓它無法違反規則。這才是真正的解決方案。