아래로 당겨서 돌아가기
최신 AI가 이제 나쁜 지시를 거부할 수 있게 됐다

최신 AI가 이제 나쁜 지시를 거부할 수 있게 됐다

Frontier LLMs Just Got Better at Ignoring Bad Instructions—Here's How

ChatGPT가 누군가의 교활한 프롬프트에 속아서 당신이 요청하지 않은 일을 할까봐 걱정한 적 있나요? 연구자들이 AI 모델을 이런 공격으로부터 보호하는 방법을 찾아냈어요. IH-Challenge라고 불리는 이 기술은 기본적으로 신뢰할 수 있는 지시를 우선시하고 악의적인 프롬프트 주입을 무시하도록 AI를 훈련시킵니다. 마치 당신의 AI 어시스턴트에게 누군가 속이려는 건지, 아니면 정당한 요청인지 구분하는 법을 가르치는 것처럼요. 결과적으로 조작하기 어렵고, 더 안전하며, 당신이 실제로 원하는 일을 제대로 수행하는 모델이 탄생합니다. AI가 점점 더 강력해질수록 올바른 지시를 따르도록 하는 것이 중요해지니까, 이건 정말 중요한 발전입니다.

키워드

instruction hierarchyprompt injectionsafetysteerabilityLLM trainingIH-Challenge