
OpenAI 라이브스트림
OpenAI가 라이브스트림 이벤트를 개최합니다. 방송 중에 구체적인 발표, 신제품 출시 또는 시연이 공개될 예정입니다.
The last time OpenAI did an unannounced livestream, they dropped GPT-4 Turbo and changed pricing overnight

연구자들이 흥미로운 실험을 했습니다. 같은 이야기의 두 가지 약간 다른 버전을 AI 모델에 보여주되, 순서를 바꿔서 다시 보여줘서 이 "AI 판사"들이 판단을 바꾸는지 확인한 것입니다. 결과는 걱정스럽습니다. 중앙값 모델은 45%의 경우에 자기 모순을 일으키고, GPT-5.4는 무려 66%입니다. 더 나쁜 것은 이 모델들이 먼저 나타난 선택지를 더 자주 고르는 것뿐만 아니라, 그것에 더 높은 점수를 준다는 것입니다. 평균적으로 +0.26점(만점 7점)의 가산점을 줍니다. 이것은 AI의 근본적인 문제를 드러냅니다. 실제로는 공정하게 추론하지 않고 있다는 뜻입니다. 단지 처음 본 것에 맹목적으로 편향되어 있을 뿐입니다. 완전한 벤치마크 데이터, 그래프, 원본 데이터는 GitHub에서 확인할 수 있습니다.