往下拉回到首頁
他用「看整個對話」的方式抓 AI 注入攻擊,比一句句檢查聰明多了

他用「看整個對話」的方式抓 AI 注入攻擊,比一句句檢查聰明多了

Most injection detectors score each prompt in isolation. I built one that tracks the geometric trajectory of the full session. Here is a concrete result.

欸你知道嗎,現在很多人在用 ChatGPT 或 Claude 做工作,但其實有人可以偷偷在提示詞裡下指令讓 AI 做壞事,這叫「注入攻擊」。有個工程師開發了 Arc Gate,簡單來說就是一個保鑣,只要改一個網址設定,就能自動擋掉這些攻擊,還能看 AI 在做什麼。 最猛的是他用了一個很複雜的數學方法——什麼費雪資訊流形啦、相位轉變啦——來追蹤整個對話的「軌跡」,而不是像其他人一樣只看單句。說真的有點扯,他發現物理學裡描述東西穩不穩定的數學,竟然也能用來看 AI 會不會被騙。這就像是用地震學來預測謠言傳播一樣,跨界到不行。如果你公司有在用 AI,這個可能值得看看。