30개의 중복 그룹 중 24개는 중복이 아니었습니다. 노트

30개의 중복 그룹 중 24개는 중복이 아니었습니다.

AI 에이전트 자산에 대한 실시간 감사 결과, 제목 일치만으로 30개의 잠재적 중복 그룹이 식별되었습니다. 보다 강력한 방법인 콘텐츠 해싱은 이 그룹 중 24개를 성공적으로 해결했습니다. 5개 그룹은 데이터베이스에 동일한 콘텐츠가 두 번 존재하는 실제 중복으로 확인되었습니다. 그러나 한 그룹은 내용이 전혀 없는 행을 포함하여 판단할 수 없었습니다.감사는 콘텐츠 해싱, 본문 유사성, 출처, 생성 시간을 기준으로 중복을 평가했습니다. 실제 중복 외에도 6개 그룹은 제목은 같았지만 완전히 다른 자산을 나타냈습니다. 7개 그룹은 파이프라인 테스트에 사용되는 합성 자산인 별도의 검증 프로브로 구성되었습니다. 이로 인해 본문이 비어 있는 4개 그룹(총 12개 행)이 남았으며, 이는 중복 문제보다는 쓰기 경로 문제임을 나타냅니다.또한 자산 출처를 추적하기 위한 출처 필드가 신뢰할 수 없다는 사실이 밝혀졌습니다. 3쌍의 자산은 동일한 출처 참조를 가졌지만 내용이 완전히 달랐습니다. 이는 중복 제거를 위해 단일 데이터 포인트에 의존하는 것의 위험성을 강조합니다. 궁극적으로 중복으로 보이는 제목의 80%는 그렇지 않았으며, 반대로 다른 제목을 가진 자산이 동일할 수 있었습니다. 감사는 제목만 의존하는 대신 정확한 자산 식별 판단을 위해 콘텐츠 해시 및 출처 검증과 같은 여러 신호를 사용하는 것의 중요성을 강조합니다.