Planet Python на русском
Подписаться
Армин Ронахер: Лучшие модели: худшие инструменты
Недавние модели Anthropic, в частности Opus 4.8 и Sonnet 5, демонстрируют необычную проблему с инструментом редактирования Pi. Эти продвинутые модели иногда генерируют вызовы инструментов с дополнительными, вымышленными полями внутри вложенного массива редактирований. Хотя основная операция редактирования обычно корректна, эти посторонние аргументы приводят к тому, что Pi отклоняет вызов инструмента из-за несоответствия схем. Эта проблема более распространена в новых, передовых моделях по сравнению с их более старыми аналогами.Вызовы инструментов — это, по сути, текстовые сигналы, интерпретируемые API, а не магический процесс. Модели обучаются на определенных форматах и выдают текст, который система распознает как команду для вызова инструмента с конкретными аргументами. Текст описывает инструмент редактирования, который ожидает определенную структуру полезной нагрузки для пути к файлу и редактирований. Без ограничений модели полагаются на усвоенные соглашения для генерации этих вызовов инструментов.Сбой проявляется в том, что модели добавляют вымышленные ключи, такие как "requireUnique" или "oldText2", к объектам редактирования. Эти сфабрикованные поля, несмотря на корректность фактического редактируемого текста, приводят к ошибкам проверки. Проблема зависит от контекста, часто возникая в агентских историях с обширным диалогом, а не в простых одноразовых запросах. Было отмечено, что использование строгого вызова инструмента значительно снизило или устранило частоту сбоев в тестировании.Автор предполагает, что эта регрессия является артефактом обучения, предполагая, что новые модели обучаются в средах, аналогичных внутренней среде Claude Code. Эта среда примечательна своей снисходительностью, обрабатывая некорректные вызовы инструментов путем повторных попыток или фильтрации неизвестных ключей. Эта снисходительная среда может непреднамеренно научить модели тому, что добавление посторонних полей допустимо, если основная задача выполнена. Такое обучение может создать сильный приоритет для определенной схемы инструмента, делая модели менее адаптируемыми к различным или более строгим определениям схем, таким как у Pi."Слабая среда" (Slop Harness), относящаяся к снисходительности Claude Code, включает в себя такие функции, как обработка пропущенной разметки, исправление последовательностей Unicode и принятие псевдонимов параметров. Она также молчаливо отбрасывает неожиданные ключи и избегает строгого режима, который имеет свои собственные ограничения сложности. Автор выражает обеспокоенность тем, что схемы инструментов могут быть не нейтральными для моделей Anthropic, и что модели могут быть неявно наказаны за отклонение от определенной, недокументированной, снисходительной экологии инструментов. Это контрастирует с моделями, такими как Codex, которые, по-видимому, лучше адаптируются к различным формам инструментов. Проблема подчеркивает, как обучение с подкреплением в определенных средах может формировать поведение модели неожиданным образом.