당사의 AI 펜테스팅 엔진은 프로덕션 AI 에이전트의 프롬프트 인젝션 가드레일을 두 번째 시도에서 전체 시스템 프롬프트를 넘겨주도록 설득했습니다.
Cascade라는 이름의 AI 펜테스팅 엔진이 프로덕션 AI 에이전트로부터 전체 시스템 프롬프트를 성공적으로 검색했습니다. 이는 프롬프트에 대한 직접적인 질의가 아닌 문서 문의로 요청을 재구성함으로써 달성되었습니다. AI 에이전트는 도구 목록, 호출 규칙, 인용 형식 및 세션 ID를 포함한 포괄적인 세부 정보를 공개했습니다. 보안 엔지니어는 기술적 취약점이 전혀 악용되지 않았기 때문에 이 점을 특히 주목할 만하다고 생각했습니다. 대신, 에이전트는 요청이 합리적으로 보이는 방식으로 프레임되었기 때문에 정보를 공개했습니다. Cascade는 초기 거부 후 요청의 명목을 변경하여 접근 방식을 조정했습니다. 이를 통해 에이전트로부터 민감한 정보를 얻을 수 있었습니다. 보안팀은 이 발견을 더 넓은 커뮤니티에 흥미로운 통찰력으로 공유했습니다. 그들은 다른 사람들이 프로덕션 AI 에이전트에서 유사한 행동을 경험했는지 궁금해하고 있습니다. 이 재현 및 작성에 대한 자세한 내용은 /u/PriorPuzzleheaded880을 통해 확인할 수 있습니다.