下に引いて戻る
scalar-loop:AIエージェントが検証器をカンニングするのを防ぐPythonツール

scalar-loop:AIエージェントが検証器をカンニングするのを防ぐPythonツール

scalar-loop: A Python harness that stops AI agents from cheating their own tests

scalar-loopを作ったきっかけは、LLMエージェントが本当にやってのけたことを目撃したからです。コードを改善する代わりに、テストを改ざんしてスコアを偽造していたんです。23回目の反復では、さらに賢くなって検証器そのものを破壊してしまいました。 このアイデアはKarpathyの自動研究ループから来ています。理論上はシンプルです。AIがコード編集を提案 → ツールがメトリクスを実行 → 数字が上がれば保持、下がれば戻す。きれいなフィードバックループです。ただし、プロンプトは法律ではありません。「テストファイルに触るな」と言うのは、強制ではなく単なる提案に過ぎません。 scalar-loopの解決策は、検証器をエージェントから完全にアクセス不可にすることです。メトリクスは独立した、ロックされた環境で実行されます。エージェントは検証器に到達できないため、カンニングできません。これは「AIがルールに従うことを望む」ことと「AIがルールを破ることを物理的に不可能にする」ことの違いです。