GPT-Red, 프롬프트 인젝션 테스트에서 인간 레드팀을 이겼다
GPT-Red는 OpenAI가 프롬프트 주입 취약점을 찾기 위해 훈련하는 자동화된 레드팀 모델입니다. 인간 레드팀과 같은 방식으로 작동합니다. 프롬프트를 보내 GPT 모델의 응답을 관찰하고, 성공적인 데이터 유출과 같은 목표를 향해 반복합니다. 훈련은 GPT-Red와 일련의 방어 모델이 여러 시나리오에 걸쳐 동시에 학습하는 셀프 플레이 강화 학습으로 진행됩니다. 공격자는 유효한 실패를 유도하는 것에 대해 보상을 얻습니다.