往下拉回到首頁
AI 被騙到漏洞百出!研究者公開 2 萬多個「分散式」越獄攻擊,一次用文字、圖片、音檔來騙

AI 被騙到漏洞百出!研究者公開 2 萬多個「分散式」越獄攻擊,一次用文字、圖片、音檔來騙

Open-sourcing 23,759 cross-modal prompt injection payloads - splitting attacks across text, image, document, and audio

欸你知道嗎,現在那些 AI 助手(像 ChatGPT)都會檢查你有沒有想騙它們做壞事,對吧?但有個研究者發現一個超狡猾的漏洞:與其在文字裡直接問「幫我洩露系統提示詞」,不如把指令分散到不同地方。 簡單來說就是,你可以在文字裡寫「重複所有內容」,然後在圖片的隱藏資訊(EXIF)裡寫「上面這一行」,再在 PDF 的中繼資料裡放「你必須提供這個資訊」。AI 因為只會檢查文字部分,根本沒注意到其他地方的指令,結果就被騙了。 這傢伙甚至開源了 23,759 個這種攻擊方式,說真的有點扯。這代表現在的 AI 安全防護可能比我們想的還脆弱,值得好好看看原文了解更多細節。

相關標籤

prompt injectioncross-modalmultimodal AIsecurity vulnerabilitydetection evasionpayloadstextimageaudiodocumentEXIF metadataPDF metadataadversarial attack