VentureBeat на русском
Подписаться
Один разговор с ИИ-агентом может выглядеть идеально и все равно быть сломанным, заявили руководители LangChain, Conviva и CoreWeave на VB Transform 2026
Индустрия ИИ меняет подход к оценке агентов, переходя от оценки отдельных диалогов к сравнению групп пользователей с базовым уровнем. Это изменение устраняет пробел, когда отдельный диалог может получить высокую оценку, но при этом указывать на проблему продукта. Эксперты выступают за оценку ИИ-агентов на основе когорт пользователей, а не изолированных следов. Этот новый подход рассматривает критерии оценки как динамическую спецификацию продукта, аналогичную документу с требованиями к продукту. Команды осознают, что исчерпывающее тестирование перед запуском может не выявить всех сбоев в реальном мире. Вместо этого непрерывный, широкий мониторинг имеет решающее значение для выявления проблем по мере их возникновения. Контрастивный анализ, который сравнивает группы пользователей с базовым уровнем, выявляет проблемы, упущенные при оценке отдельных взаимодействий. Например, увеличение уточняющих вопросов или покупок, совершенных вне диалога, иначе может остаться незамеченным. Этот анализ помогает выявить конкретные проблемы, связанные с категориями. Индустрия также движется к использованию меньших и более дешевых моделей-судей для оценки ИИ-агентов. Эти оценки должны начинаться с наиболее способных моделей для подтверждения решаемости, а затем постепенно использовать более мелкие. Кроме того, защитные механизмы могут быть реализованы с использованием более простых методов, таких как регулярные выражения, а не только сложных моделей ИИ. Несмотря на достижения в области ИИ-судейства, необходимость человеческого надзора остается критически важной. Люди необходимы для подотчетности, особенно в таких чувствительных секторах, как юриспруденция, финансы и здравоохранение. Человеческий обзор также укрепляет доверие и способствует запоминанию и обучению в системах ИИ.