모델이 자체 AI 코드를 검토하도록 해서는 안 되는 이... 노트

모델이 자체 AI 코드를 검토하도록 해서는 안 되는 이유

최근 arXiv 논문은 AI 코드 검토 패턴의 구조적 약점을 강조합니다. 이 논문은 요구사항과 배포 환경에 대한 소프트웨어 구현을 평가하기 위한 두 개의 간극 프레임워크를 소개합니다. 요구사항 간극은 이해관계자의 요구와 문서화된 요구사항 사이에 존재하며, 모델 간극은 가정된 배포 환경과 실제 배포 환경 간의 차이입니다. AI 환각은 정보를 날조함으로써 이 두 간극을 모두 악화시킵니다.이 논문은 코드를 생성하는 동일한 AI 모델이 이를 검토할 때, 동일한 결함이 있는 요구사항과 환경 모델을 사용하여 검토한다고 주장합니다. 이는 AI가 본질적으로 자신의 가정과 맹점을 다시 확인하는 것이기 때문에 검증에 대한 잘못된 인식을 초래합니다. 자체 검토는 모델이 이미 문제로 인식하는 오류만 감지하며, 잘못된 가정을 공유하는 코드를 통과시킵니다.이러한 간극을 효과적으로 좁히기 위해 이 논문은 두 가지 핵심 전략을 제안합니다. 교차 모델 검토는 두 번째 독립적인 AI 모델이 처음부터 요구사항과 환경 가정을 재도출하여 공유된 맹점을 완화하는 것을 포함합니다. 다른 중요한 전략은 현실이 궁극적인 검증자이므로 프로덕션과 유사한 환경에서 코드를 실행하는 것입니다.배포 전 평가는 대리이며, 실행 기반 검사는 관찰 가능한 동작을 요구하기 때문에 정적 평가보다 우수합니다. 이 논문은 인간의 판단을 요구사항 간극에 대한 희소 자원으로, 정확한 평가는 모델 간극에 대한 병목 현상으로 프레임합니다. AI 생성 코드의 양을 고려할 때, 합리적인 접근 방식은 AI 생성 diff가 독립적인 모델에 의해 검토된 후 실행 기반 검사를 수행하는 것을 포함합니다. 그런 다음 인간 검토는 이러한 초기 단계를 통과한 코드에 집중하여 인간 주의의 수익을 극대화해야 합니다. 동일 모델 AI 검토는 린터 역할을 할 수 있지만, 진정한 검증으로 착각해서는 안 됩니다.