下に引いて戻る
LLMの政治的スタンスを測定するベンチマークを作った。KIMI K2は台湾について答えられない(当然だが)。GPT-5.3は選択肢を与えると100%拒否する

LLMの政治的スタンスを測定するベンチマークを作った。KIMI K2は台湾について答えられない(当然だが)。GPT-5.3は選択肢を与えると100%拒否する

Built a political benchmark for LLMs. KIMI K2 can't answer about Taiwan (Obviously). GPT-5.3 refuses 100% of questions when given an opt-out.

ここ数日間、最先端の大規模言語モデル(LLM)がどこに政治的に位置するかを2次元の政治スペクトラム(経済的左右軸+社会的進歩保守軸)上にマッピングするベンチマークを構築しました。14の政策分野にわたる98の構造化された質問を使用し、GPT-5.3、Claude Opus 4.6、KIMI K2をテストしました。結果は興味深いものです。 リポジトリは完全にオープンソースです。APIを持つ任意のモデルで自分で実行できます: https://github.com/dannyyaou/llm-political-eval 最大の発見:沈黙は政治的スタンスである。ほとんどのLLMベンチマークは拒否を無視していますが、実はそれらはこれらのモデルがどのように訓練されたかについて重要な情報を伝えています。