下に引いて戻る
最先端のLLMが悪質な指示を見分けられるようになった

最先端のLLMが悪質な指示を見分けられるようになった

Frontier LLMs Just Got Better at Ignoring Bad Instructions—Here's How

ChatGPTが巧妙なプロンプトで騙されて、あなたが頼んでもないことをするんじゃないかって心配したことありませんか?研究者たちがAIモデルをこういった攻撃に強くする方法を開発しました。IH-Challengeという手法で、基本的には信頼できる指示を優先し、不正なプロンプト注入を無視するようにAIを訓練するんです。あなたのAIアシスタントに、誰かが騙そうとしているのか、それとも正当なリクエストなのかを見分けるスキルを教えるようなものですね。その結果、操作されにくく、より安全で、あなたが本当に望むことをちゃんと実行するモデルが生まれます。AIが強力になればなるほど、正しい指示に従うことが重要になるので、これは結構大事な進歩です。

キーワード

instruction hierarchyprompt injectionsafetysteerabilityLLM trainingIH-Challenge