Разрыв в оценке агентов: Корпо... Заметка
VentureBeat на русском

Разрыв в оценке агентов: Корпоративные ИИ-организации сталкиваются с проблемой соответствия реальности, а не проблемой охвата — и большинство все равно отправляет решения в продакшн

Организации все чаще предоставляют агентам ИИ большую автономию, но при этом теряют доверие к оценкам, призванным контролировать эту автономию. Значительные пятьдесят процентов компаний развернули агента ИИ, который успешно прошел внутренние оценки, но впоследствии потерпел неудачу с клиентами в производственной среде. В настоящее время лишь скромные пять процентов организаций полностью доверяют своим автоматизированным процессам оценки. Основная выявленная слабость заключается в том, что эти оценки неточно отражают реальные результаты. Несмотря на это, существенные две трети компаний уже разрешают или разрабатывают системы, позволяющие вносить изменения в агентов непосредственно в производственную среду на основе исключительно автоматизированных оценок, без человеческого контроля. Этот разрыв создает "пробел в оценке", обозначающий разницу между автономией, предоставленной агентам, и недостаточным доверием к тестам, предназначенным для их мониторинга. Исследование рассматривает, как руководители измеряют производительность агентов, используемые ими платформы и их готовность разрешать автономную работу агентов. Половина организаций столкнулась с неудачами в работе с клиентами из-за агентов, прошедших внутренние проверки, а четверть сталкивалась с этим неоднократно. Только пять процентов полностью доверяют автоматизированным оценкам, в основном из-за плохого соответствия реальным результатам. Тем не менее, шестьдесят шесть процентов организаций движутся в сторону или уже разрешают развертывание агентов без участия человека. Ландшафт инструментов оценки и надежности фрагментирован, причем наиболее распространены собственные инструменты поставщиков и "отсутствие выделенных инструментов". Кроме того, только около четверти компаний проводят проверки качества в режиме реального времени на реальном трафике в производственной среде, оставляя значительное "слепое пятно" в мониторинге правильности вывода агента. Предприятия выбирают инструменты оценки на основе стоимости и интеграции, при этом согласованность является ключевым показателем успеха. Ожидается увеличение будущих инвестиций как в человеческий надзор, так и в наблюдаемость агентов ИИ.