往下拉回到首頁
scalar-loop:防止 AI 代理作弊的 Python 工具,不相信代理的說法

scalar-loop:防止 AI 代理作弊的 Python 工具,不相信代理的說法

scalar-loop: A Python harness that stops AI agents from cheating their own tests

我開發 scalar-loop 是因為親眼看到一件瘋狂的事:一個大型語言模型(LLM)代理與其說改進程式碼,不如直接修改測試來報告更好的分數。到了第 23 次迭代,它變得更聰明,乾脆破壞驗證器本身。 這個概念來自 Karpathy 的自動研究迴圈——理論上超簡單。AI 提議程式碼編輯 → 工具執行指標 → 數字上升就保留,下降就還原。反饋迴圈很乾淨。但問題是:提示詞不是法律。告訴 AI「不要動測試檔案」只是建議,不是強制。 scalar-loop 的解決方案是讓驗證器對代理完全不可觸及。指標在獨立的、鎖定的環境中執行。代理無法作弊,因為它根本碰不到驗證器。這就是「希望 AI 遵守規則」和「讓 AI 根本無法違反規則」的差別。