Оценочный механизм обнаружил т... Заметка
VentureBeat на русском

Оценочный механизм обнаружил то, чего не смогла выявить качественная проверка: модели ИИ наиболее уверены, когда ошибаются.

Многие команды, разрабатывающие инструменты с поддержкой LLM, пропускают проверку правильности модели, фокусируясь вместо этого на беглости и связности. Это приводит к тому, что инструменты проходят внутреннюю проверку, поскольку выходные данные "звучат правильно", но терпят неудачу в производстве, поскольку им не хватает проверяемой точности по сравнению с истинными данными. Это различие становится критически важным, поскольку инструменты LLM влияют на реальные бизнес-решения, где "кажется разумным" является недостаточным стандартом.Качественные оценки, стандартный подход, выявляют только очевидные ошибки, такие как плохой формат или ответы не по теме. Они последовательно пропускают выходные данные, которые тонко ошибочны, например, уверенные, но неправильные объяснения, которые могут звучать правдоподобно, но значительно отклоняются от фактических данных. Такие ошибки остаются скрытыми без внешней валидации.Альтернативой является система оценки, которая оценивает выходные данные модели по отношению к размеченным истинным данным. Автор создал такую систему для объяснения первопричин дрейфа данных при миграции, показав, что даже беглые первоначальные прототипы часто были фактически неверны. Эта система состояла из трех частей для точной оценки.Во-первых, синтетический набор данных истинных ответов с известными правильными ответами, установленными по дизайну. Эти сценарии требовали тщательной проработки, чтобы быть реалистичными, включая шум и перекрывающиеся сигналы, для точного прогнозирования реальной производительности. Во-вторых, функция оценки, которая оценивала ранжированные выходные данные на основе наличия и ранга правильного ответа, выходя за рамки простой бинарной правильности. В-третьих, систематическая оценка по всему набору данных, а не выборочная проверка, для выявления общих закономерностей надежности или последовательных ошибок.Эта систематическая оценка показала, что сценарии изменения схемы обрабатывались надежно, но ошибки в логике преобразования часто приводили к неверной атрибуции. Критически важно, что сценарии с перекрывающимися сигналами дали самый высокий процент уверенно неправильных объяснений, результат, который качественная оценка никогда бы не выявила. Выраженная моделью уверенность не коррелировала с ее точностью.Для внедрения корпоративного ИИ, особенно для инструментов, влияющих на критические решения, команды должны измерять точность по отношению к известным правильным ответам, а не только по воспринимаемой разумности. Создание синтетического набора данных истинных ответов является наиболее сложным, но решающим шагом, требующим точного определения "правильного" для конкретного случая использования. Без этого организации рискуют развернуть инструменты, которые являются беглыми, но в корне неправильными, подрывая их ценность.
CdXz5zHNQW_R93C0pSh8T.png