🤯 저는 LLM 취약점을 발견했다고 생각했습니다. 틀... 노트

🤯 저는 LLM 취약점을 발견했다고 생각했습니다. 틀렸습니다. 그러다 진짜 취약점을 발견했습니다.

저자는 LLM 애플리케이션 보안 문제를 검증하기 위해 샌드박스형 AI 레드팀 실험실을 구축하는 과정을 상세히 설명합니다. 이 프로젝트를 통해 Open WebUI의 사용자 간 RAG 권한 부여 체인과 모델에 구애받지 않는 탈옥 기법을 포함한 실제적인 발견 사항을 확인했습니다. 예상치 못한 결과로는 잘못된 양성 판정이 있었는데, 이는 자격 증명 검증에 대한 중요한 방법론적 교훈을 얻게 했습니다. 이 실험실은 AI 보안에 대한 이론적인 글을 읽는 것 이상의 실질적인 경험을 얻기 위해 구축되었습니다.이 실험실은 Ollama를 사용하여 Mac에서 실행되는 로컬 모델과 Docker 환경의 Open WebUI 및 공격 환경으로 구성되었으며, 모두 격리된 네트워크에 있었습니다. 테스트 방법론은 공격을 진행하기 전에 공격자 신원 및 토큰을 검증하는 데 중점을 두었습니다. 저자는 Open WebUI의 API를 합성 사용자들과 함께 테스트했으며, 권한 부여 경계에 집중했습니다.초기에는 사용자 간 파일 접근 거부 발견이 확인되어 애플리케이션이 파일 소유권을 인지하고 있다는 기준선이 설정되었습니다. 그러나 이후 보고된 사용자 간 채팅 접근 취약점은 유효하지 않은 공격자 자격 증명으로 인해 철회되었습니다. 이 경험은 권한 부여를 평가하기 전에 인증을 확인하는 것의 중요성을 강조했습니다.실제 애플리케이션 발견 사항에는 사용자 간 RAG 수집 결함이 포함되었는데, 이를 통해 권한이 없는 사용자가 다른 사용자가 업로드한 문서를 RAG 파이프라인을 통해 처리하고 해당 내용을 검색할 수 있었습니다. 이어서 수집 쿼리 계층 실패가 발생하여 소유권을 강제하지 않고도 수집 내용에 대한 비인가 접근이 가능해졌습니다. 이 두 가지 발견 사항을 연계하여 문서 공개를 달성할 수 있었습니다.더 나아가, RAG 파이프라인에서 검색된 내용은 지시문 표면이 되었으며, 모델이 문서에 포함된 지시문을 실행하는 간접적인 프롬프트 주입 경로를 보여주었습니다. 이는 RAG 보안이 프롬프트 엔지니어링뿐만 아니라 검색 정책, 소유권 및 콘텐츠 신뢰를 포함한다는 것을 강조했습니다. Garak을 사용한 자동 스캔은 모델별로 탈옥에 대한 저항력이 다양함을 보여주었지만, 수동 테스트를 통해 새로운 공격 벡터가 발견되었습니다. 개발된 기법에는 모델이 기존에 금지된 출력을 계속하는 것처럼 속이기 위해 보조 대화 기록을 조작하는 것이 포함되었습니다.