往下拉回到首頁
前沿大型語言模型現在更聰明了——能夠識別並拒絕惡意指令

前沿大型語言模型現在更聰明了——能夠識別並拒絕惡意指令

Frontier LLMs Just Got Better at Ignoring Bad Instructions—Here's How

你有沒有擔心過 ChatGPT 會被某些狡猾的提示詞騙到去做你沒有要求的事情?研究人員剛剛找到了一個方法,讓人工智慧模型在這方面表現得更好。這個方法叫做 IH-Challenge,基本上就是訓練 AI 優先執行來自信任來源的指令,而忽視那些試圖劫持它的隨意嘗試。想像一下,就像教你的 AI 助手學會分辨什麼時候有人在試圖欺騙它,什麼時候才是真正的合法請求。結果呢?模型變得更難被操縱、更安全可靠,而且真的會聽你的話,而不是被提示詞注入攻擊所迷惑。這很重要,因為隨著 AI 變得越來越強大,確保它遵循正確的指令就變成了關鍵問題。

關鍵字

instruction hierarchyprompt injectionsafetysteerabilityLLM trainingIH-Challenge