Исследователи Meta обучили 8-м... Заметка
VentureBeat на русском

Исследователи Meta обучили 8-миллиардную ИИ-модель, чтобы она соответствовала Claude Opus 4.5 — без заоблачной цены.

Агенты ИИ, выполняющие задачи с длительным горизонтом, такие как миграция данных CRM, требуют большего, чем просто внутреннюю память. Они зависят от среды выполнения, или "сбруи", для получения обратной связи по выполнению и управления состоянием. Традиционно разработчики пошагово программируют поведение агентов, ограничивая их автономию и адаптивность. EvoHarness-RL, разработанный Meta AI и Университетом Иллинойса в Урбана-Шампейн, представляет собой унифицированное рабочее пространство под названием Belief, Progress, and Experience (BPE) для расширения возможностей агентов. Belief отслеживает среду, Progress управляет подцелями, а Experience хранит исторические знания. Агенты взаимодействуют с BPE, используя четыре мета-действия: track (отслеживать), commit (фиксировать), recall (вспоминать) и note (замечать). Эта структура позволяет агентам учиться, когда и как получать доступ к своему внешнему состоянию и обновлять его. EvoHarness-RL включает в себя контролируемую дообучение для структурирования данных и обучение с подкреплением с учетом затрат для оптимизации использования инструментов на основе вычислительных расходов. В тестовых испытаниях EvoHarness-RL значительно улучшил производительность небольших моделей ИИ, даже сравнившись с производительностью более крупных проприетарных моделей. Эта структура также приносит пользу существующим передовым моделям, улучшая их выполнение с помощью "сбруи" BPE во время запроса. Во время обучения EvoHarness-RL демонстрирует "отжиг сбруи", когда агенты снижают зависимость от внешних инструментов для рутинных задач, и "эволюцию сбруи", когда они динамически адаптируют стратегию в зависимости от сложности задачи. Адаптер среды облегчает интеграцию в существующие корпоративные системы без необходимости полной переработки текущих инструментов или фреймворков агентов. EvoHarness-RL представляет собой сдвиг от программирования поведения агентов к созданию систем, в которых может быть изучено лучшее поведение, что особенно ценно для длительных и сложных задач.
CdXz5zHNQW_vFMdHvCqG6.jpeg