往下拉回到首頁
AI 現在學會拒絕壞人的指令了,你的資訊更安全了

AI 現在學會拒絕壞人的指令了,你的資訊更安全了

Frontier LLMs Just Got Better at Ignoring Bad Instructions—Here's How

你知道嗎,有時候有人會用一些狡猾的方式去騙 ChatGPT,讓它做一些不該做的事情?就像有人偷偷在你的指令裡面插入一些惡意的東西,想要劫持 AI 去做壞事。現在研究人員開發了一個叫 IH-Challenge 的訓練方法,簡單來說就是教 AI 學會分辨誰的指令是可信的、誰的是在搗亂。這就像是教你的 AI 助手練就一雙火眼金睛,能夠識別出真正的請求和那些試圖欺騙它的把戲。結果就是 AI 變得更聰明、更難被騙、也更安全。說真的,這對我們日常使用 AI 的人來說滿重要的,因為 AI 越來越聰明,如果它能更好地保護自己不被騙,我們用起來也就更放心了。

相關標籤

instruction hierarchyprompt injectionsafetysteerabilityLLM trainingIH-Challenge