30の重複グループのうち24は重複ではありませんでした ノート

30の重複グループのうち24は重複ではありませんでした

AIエージェント資産のライブ監査により、タイトルの一致のみに基づいて30の潜在的な重複グループが特定されました。より堅牢な方法であるコンテンツハッシュは、これらのグループのうち24を正常に解決しました。5つのグループは実際の重複として確認され、データベース内に同一のコンテンツが2つ存在することを意味します。しかし、1つのグループはコンテンツが全くない行を含んでおり、判断不能となりました。監査は、コンテンツハッシュ、本文の類似性、来歴、作成時間に基づいて重複を評価しました。実際の重複以外に、6つのグループは同じタイトルを持っていましたが、完全に異なる資産を表していました。7つのグループは、パイプラインテストに使用される合成資産である、異なる検証プローブで構成されていました。これにより、本文が空の4つのグループ、合計12行が残り、これは重複問題ではなく書き込みパスのインシデントを示唆しています。さらに、資産の起源を追跡することを意図した来歴フィールドは、信頼できないことが判明しました。3組の資産は同一の来歴参照を持っていましたが、コンテンツは全く無関係でした。これは、重複排除のために単一のデータポイントに依存することの危険性を浮き彫りにしています。最終的に、重複しているように見えたタイトルの80%は実際には重複しておらず、逆に、異なるタイトルを持つ資産が同一である可能性がありました。この監査は、タイトルだけに依存するのではなく、正確な資産の同一性判断のために、コンテンツハッシュや来歴検証のような複数のシグナルを使用することの重要性を強調しています。