На переднем крае и в центре: К... Заметка

На переднем крае и в центре: Кто оценивает оценки?

Агенты ИИ обычно оцениваются по фиксированным этапам, в результате чего получается единый балл, который дает ограниченное представление об их возможностях. Такой подход недостаточен, поскольку он не позволяет выявить, где производительность агента снижается или насколько легко ему удалось добиться успеха. Для агентов данных понимание этих нюансов имеет решающее значение для эффективного поиска данных, задачи "иголка в стоге сена", где агенты должны идентифицировать релевантные наборы данных по расплывчатым запросам человека.Для решения этой проблемы предлагается основанный на теории информации подход под названием Discovery Bench, который призван повысить точность этапов. Эта структура модулирует сложность оценочных случаев, генерируя легкие и сложные варианты каждого запроса, что позволяет более детально понять производительность агента. Основная концепция модуляции сложности — "удивление", которое измеряет неопределенность, остающуюся относительно правильного набора данных, учитывая запрос. Информативные термины в запросе имеют высокое удивление, резко отличая цель от других.Добавляя или удаляя термины с различной информативной силой, можно регулировать сложность оценочных случаев. Этот метод, называемый итеративным уточнением запросов на основе удивления (iSQR), генерирует запросы с откалиброванными уровнями неоднозначности (высоким, средним, низким), основанными на битах, а не на субъективном мнении. Это позволяет более объективно оценивать сложность, объясняя, почему были добавлены или удалены конкретные слова.Discovery Bench выявил "обрывы" в производительности агентов, когда небольшое увеличение неоднозначности приводит к полному сбою, явление, упущенное традиционными оценками "прошел/не прошел". Он также определяет "зону комфорта" для неоднозначности, показывая, что большая конкретность не всегда лучше для производительности агента. Это дает действенные сигналы для улучшения агентов, такие как устранение конкретных режимов сбоев, таких как таблицы с временными сегментами или перегрузка контекста.Область движется в сторону мета-бенчмаркинга, при этом другие исследования изучают теорию ответов на элементы и прямую проверку истинности. Важным выводом из внедрения Discovery Bench стало обнаружение значительных ошибок в устоявшемся этапе KramaBench-astronomy. Это подчеркивает критическую необходимость "оценивать свои оценки", поскольку ошибочные этапы приводят к неверным выводам о производительности агента.Более того, сам метод генерации проходов неоднозначности нуждается в оценке. При сравнении управляющих терминов, сгенерированных LLM, с терминами, основанными на удивлении TF-IDF, результаты резко отличались, подчеркивая необходимость надежной оценки самого метода оценки. Вывод заключается в том, что оценки должны давать сигналы, а не просто вердикты, обеспечивая непрерывную ось оценки и подвергая оценщиков такой же тщательной проверке, как и агентов.
CdXz5zHNQW_t9bEdQkNbb.jpeg