Recent Announcements на русском
Подписаться
AWS анонсирует aws-bench, открытый бенчмарк для ИИ-агентов на AWS
Сегодня AWS анонсирует предварительный просмотр aws-bench, открытого набора тестов, который измеряет, насколько точно и эффективно ИИ-агенты выполняют реальные задачи AWS. Поставщикам моделей и исследователям ИИ, создающим агентов, работающих на инфраструктуре AWS, нужен объективный, воспроизводимый способ измерения производительности и диагностики сбоев. aws-bench предоставляет общедоступный набор тестовых случаев, основанных на анализе реального использования AWS, включая задачи по исследованию, устранению неполадок и созданию инфраструктуры. Каждый тестовый случай сопоставляет запрос на естественном языке с определенным состоянием облачного ресурса и эталонным ответом, что позволяет оценивать любого агента или модель на последовательной, проверяемой основе. Исследователи и поставщики моделей могут использовать aws-bench для улучшения производительности базовых моделей в задачах AWS, улучшения оболочек агентов и отслеживания прогресса. Релиз включает в себя простой в использовании инструмент командной строки для создания тестовых сред, выполнения и оценки тестовых запусков, а также сброса состояния ресурсов. aws-bench доступен сейчас на GitHub. Чтобы начать, следуйте инструкциям по настройке в README.