아래로 당겨서 돌아가기
LLM의 정치적 입장을 측정하는 벤치마크를 만들었다. KIMI K2는 대만에 대해 답할 수 없다(당연히). GPT-5.3은 선택지를 주면 100% 거부한다

LLM의 정치적 입장을 측정하는 벤치마크를 만들었다. KIMI K2는 대만에 대해 답할 수 없다(당연히). GPT-5.3은 선택지를 주면 100% 거부한다

Built a political benchmark for LLMs. KIMI K2 can't answer about Taiwan (Obviously). GPT-5.3 refuses 100% of questions when given an opt-out.

지난 며칠간 최첨단 대형언어모델(LLM)들이 2차원 정치 스펙트럼(경제 좌우축 + 사회 진보보수축) 위에서 어디에 위치하는지 매핑하는 벤치마크를 만들었습니다. 14개 정책 분야에 걸친 98개의 구조화된 질문을 사용해 GPT-5.3, Claude Opus 4.6, KIMI K2를 테스트했습니다. 결과는 정말 흥미롭습니다. 저장소는 완전히 오픈소스입니다. API가 있는 모든 모델에서 직접 실행할 수 있습니다: https://github.com/dannyyaou/llm-political-eval 가장 주목할 만한 발견: 침묵도 정치적 입장이다. 대부분의 LLM 벤치마크는 거부 응답을 무시하지만, 사실 그것들이 이 모델들이 어떻게 훈련되었는지를 보여주는 중요한 신호입니다.