DEV Community на русском
Подписаться
24 из 30 групп дубликатов не были дубликатами.
В ходе живого аудита активов ИИ-агентов было выявлено 30 групп потенциальных дубликатов, основанных исключительно на совпадении названий. Хеширование контента, более надежный метод, успешно разрешил 24 из этих групп. Пять групп были подтверждены как подлинные дубликаты, что означает, что идентичный контент существовал в базе данных дважды. Одна группа, однако, содержала строки без какого-либо контента, что делало их не поддающимися оценке.Аудит оценивал дубликаты на основе хеширования контента, сходства тела, происхождения и времени создания. Помимо подлинных дубликатов, шесть групп имели одинаковое название, но представляли собой совершенно разные активы. Семь групп состояли из различных тестовых запросов, синтетических активов, используемых для тестирования конвейеров. Осталось четыре группы, всего 12 строк, с пустыми телами, что указывает на инцидент на пути записи, а не на проблему дублирования.Кроме того, поле происхождения, предназначенное для отслеживания источника актива, оказалось ненадежным. Три пары активов имели идентичные ссылки на происхождение, но совершенно не связанные контент. Это подчеркивает опасность опоры на один показатель данных для дедупликации. В конечном итоге 80% названий, которые казались дублированными, таковыми не являлись, и наоборот, активы с разными названиями могли быть идентичными. Аудит подчеркивает важность использования нескольких сигналов, таких как хеш контента и проверка происхождения, для точной оценки идентичности активов, а не полагаться только на название.