下に引いて戻る
訓練方法を少し変えるだけで、AIモデルが人間の評価で63%の勝率を獲得—でも性能指標には変化なし

訓練方法を少し変えるだけで、AIモデルが人間の評価で63%の勝率を獲得—でも性能指標には変化なし

A Simple Training Tweak Makes AI Models 63% Better at Human Judgment—Without Changing Performance Metrics

研究者たちが同じデータで訓練した12億パラメータの2つのAIモデルを比較しました。唯一の違いは、一方が予測符号化にインスパイアされた新しい訓練方法(精度加重ゲインと層別勾配スケーリング)を使い、もう一方が標準的な訓練を使ったこと。ここが面白いところ—両モデルの性能指標はほぼ同じなのに、10人の評価者(人間7人 + AI3つ)が盲検比較したとき、新しい方法を63.4%の確率で選んだんです。つまり、新しい訓練方法は何か意味のあるものを生み出しているのに、標準的な指標では全く見えていないということ。統計的有意性はp = 1.98 × 10⁻⁵で、これは偶然ではありません。含意は?AIの品質を測定する方法が間違っているのかもしれません。