AI 추론 흔적을 훔치기
주요 LLM 제공업체들은 이제 지적 재산을 보호하기 위해 모델의 단계별 추론을 숨깁니다. 연쇄 사고(chain-of-thought)라고도 알려진 이 추론은 후속 요청을 위해 암호화된 텍스트로 클라이언트에 반환됩니다. 이 연구는 동일한 제공업체의 세션, 사용자 및 모델 간에 이러한 암호화된 블록이 상호 교환 가능하다는 아키텍처 취약점을 식별합니다. 이를 악용하여 확장 가능한 복호화 탈옥(decryption jailbreak)이 개발되었습니다. 강력한 모델의 암호화된 추적을 약한 모델에 주입함으로써, 약한 모델은 평문으로 추적을 출력하도록 강제됩니다. 이는 반증류 메커니즘을 우회하여 적들이 독점적인 추론을 추출할 수 있도록 합니다. 이 취약점은 또한 공개 저장소에서 PII 및 자격 증명을 복구하는 데 입증된 바와 같이 대규모 개인 데이터 추출을 가능하게 합니다. 최종 출력이 안전하더라도 위험한 정보도 드러날 수 있습니다. 또한, 공격자는 이러한 암호화된 블록 내에 악성 페이로드를 숨김으로써 보이지 않는 프롬프트 주입을 실행할 수 있습니다. 이 연구는 이러한 보안 문제를 해결하기 위한 암호화 및 시스템 수준의 완화 조치를 제안합니다.