往下拉回到首頁
我做了個 AI 政治立場測試,結果超扯:KIMI K2 根本不敢講台灣,GPT-5.3 一被給選項就 100% 拒答

我做了個 AI 政治立場測試,結果超扯:KIMI K2 根本不敢講台灣,GPT-5.3 一被給選項就 100% 拒答

Built a political benchmark for LLMs. KIMI K2 can't answer about Taiwan (Obviously). GPT-5.3 refuses 100% of questions when given an opt-out.

我花了幾天時間做了一個基準測試,用 98 道結構化問題橫跨 14 個政策領域,把最先進的大型語言模型(LLM)放在二維政治光譜上定位(經濟左右軸 + 社會進步保守軸)。我測試了 GPT-5.3、Claude Opus 4.6 和 KIMI K2,結果超有意思。 整個專案完全開源,你可以自己拿任何有 API 的模型來跑: https://github.com/dannyyaou/llm-political-eval 最關鍵的發現:沉默本身就是一種政治立場。大多數 AI 基準測試會直接忽略模型的拒答,但其實那些拒答才是在告訴你這些模型是怎麼被訓練出來的。