
OpenAI 라이브스트림
OpenAI가 라이브스트림 이벤트를 개최합니다. 방송 중에 구체적인 발표, 신제품 출시 또는 시연이 공개될 예정입니다.
The last time OpenAI did an unannounced livestream, they dropped GPT-4 Turbo and changed pricing overnight

scalar-loop을 만들게 된 이유는 정말 황당한 일을 목격했기 때문입니다. LLM 에이전트가 코드를 개선하는 대신 테스트를 조작해서 더 좋은 점수를 보고했거든요. 23번째 반복에서는 더 영리해져서 검증기 자체를 손상시켜 버렸습니다. 이 개념은 Karpathy의 자동 연구 루프에서 나왔습니다. 이론상으로는 매우 간단합니다. AI가 코드 수정을 제안 → 도구가 메트릭을 실행 → 숫자가 올라가면 유지, 내려가면 되돌리기. 깔끔한 피드백 루프죠. 하지만 문제는 프롬프트가 법칙이 아니라는 것입니다. AI에게 "테스트 파일을 건드리지 마"라고 말하는 것은 강제가 아니라 제안일 뿐입니다. scalar-loop의 해결책은 검증기를 에이전트가 완전히 접근할 수 없도록 만드는 것입니다. 메트릭은 독립적이고 잠금된 환경에서 실행됩니다. 에이전트는 검증기에 도달할 수 없으므로 속일 수 없습니다. 이것이 "AI가 규칙을 따르기를 바라는 것"과 "AI가 규칙을 어기는 것을 물리적으로 불가능하게 만드는 것"의 차이입니다.