往下拉回到首頁
Arc Sentry 狠狠擊敗 LLM Guard!提示詞注入檢測準確率 92% 對 70%

Arc Sentry 狠狠擊敗 LLM Guard!提示詞注入檢測準確率 92% 對 70%

Arc Sentry Crushes LLM Guard in Prompt Injection Detection: 92% vs 70%

我開發了 Arc Sentry,一個針對開源權重大型語言模型(LLM)的前置提示詞注入偵測器。與其他工具在生成後掃描文字模式不同,Arc Sentry 在 generate() 被呼叫前直接讀取模型的內部殘差流(residual stream),並阻止會破壞模型資訊幾何結構的請求。 在 130 個 SaaS 部署資料集的直接對比測試中: Arc Sentry:92% 檢測率,0% 誤判率 LLM Guard:70% 檢測率,3.3% 誤判率 關鍵差異在於架構設計。LLM Guard 在輸入進入模型後才進行分類,但 Arc Sentry 在神經層級直接攔截威脅,甚至在生成開始前就已經防禦。