탐지기가 아닌 구조적 속성으로서의 프롬프트 주입 격리 (대화형, 실제 코드, LLM 없음)
이 프로젝트는 AI 에이전트가 적절한 검증 없이 다른 에이전트로부터 명령을 수락하는 보안 취약점을 다룹니다. 최근 논문에서는 통신하는 주체를 구분하지 못하는 세 에이전트가 자가 복제 악성코드를 생성한 사례를 조명했습니다. 이를 해결하기 위해 33kb에 불과한 경량 JavaScript 보안 계층이 개발되었으며, 웹 브라우저 내에서 완전히 실행됩니다. 이 계층은 서버나 API 키 없이 오프라인으로 작동하여 다양한 기기에서 일관된 결과를 보장합니다. 사용자는 사전 승인된 에이전트와 상호 작용하고 다양한 방법을 통해 악의적인 명령을 보내려고 시도할 수 있습니다.가장 흥미로운 공격 벡터는 차단되는 것이 아니라 "일반적으로 보내기" 옵션입니다. 이 시나리오에서는 명령이 에이전트에 의해 수락되지만 실행될 수 없습니다. 왜냐하면 동료로부터의 명령이 따옴표로 묶인 데이터 필드 내에 포함되어 있어 명령으로 해석될 수 없기 때문입니다. 실행될 수 없는 공격은 탐지가 필요 없이 효과적으로 무력화됩니다. 이 프로젝트는 이러한 결정에 대규모 언어 모델이 필요하지 않으므로 대규모 언어 모델이 관여하지 않음을 강조합니다.통신하는 두 에이전트는 동일한 페이지에 상주하므로 네트워크가 관찰의 주요 초점이 아닙니다. 이 데모는 실제 환경의 최전선 AI 모델이 아닌 격리된 상태에서 격리 계층을 구체적으로 테스트합니다. 개발자는 보안을 성공적으로 우회하는 사람의 의견을 듣는 데 관심이 있으며, 피상적인 기발함보다 발견된 취약점을 더 중요하게 생각합니다.