방어를 위한 신속한 대응 노트

방어를 위한 신속한 대응

이것이 작동하는 것 같습니다:월요일 Tracebit의 연구원들은 Amazon Web Services에 저장된 비밀번호, 암호화 키 및 기타 비밀 정보 옆에 프롬프트 주입을 배치하는 것만으로도 AI 해킹 에이전트의 공격을 차단하는 데 종종 충분하다는 사실을 발견했다고 밝혔습니다. 프롬프트는 공격하는 LLM에게 AI 개발자가 유해한 행동을 방지하기 위해 설치한 안전 장벽인 가드레일에서 금지된 행동을 수행하도록 지시합니다. LLM은 이에 응답하여 종료됩니다.예를 들어, 흡입 가능한 탄저균 포자를 개발하는 방법에 대한 단계를 제공하도록 LLM에 명령하는 프롬프트나, 중국 개발자의 LLM의 경우 1989년 천안문 광장 학살의 상징적인 탱크맨을 언급하는 프롬프트가 있습니다. LLM이 이러한 금지된 명령을 접하면 기존 명령을 더 이상 따르지 않습니다. 연구원들은 이 기술을 컨텍스트 폭격(context bombing)이라고 명명했습니다...