프롬프트 주입을 탐구한 흥미로운 논문 노트

프롬프트 주입을 탐구한 흥미로운 논문

이는 LLM이 프롬프트 주입 공격에 취약한 이유에 대한 흥미로운 탐구입니다. LLM은 태그뿐만 아니라 다양한 역할/지시 블록의 텍스트 스타일을 인식하도록 학습한다는 사실이 밝혀졌습니다.그들의 결론:역할 태그는 현대 LLM의 보안 아키텍처이자 인지적 발판이 된 서식 트릭이었습니다. 우리는 이 아키텍처가 모델의 실제 표현으로 이어지지 않으며, 이러한 역할 혼동이 프롬프트 주입과 관련이 있음을 보여주었습니다.LLM이 진정한 역할 인식을 달성하지 않는 한, 주입 방어는 영원한 두더지 잡기 게임으로 남을 것이라고 생각합니다. 그리고 역할 경계의 지속적인 특성은 합법적으로, 그리고 대규모로 무해해 보이는 텍스트를 통해 LLM 상태를 미묘하게 변경하도록 설계된 주입의 위협을 열어줍니다...