DEV Community на русском
Подписаться
99% точность токенов, нулевое обучение. Полевые заметки по дообучению моделей зрения с помощью RL.
Автор рассказывает об опыте тонкой настройки моделей зрения-языка, подчеркивая, что многие неудачи были вызваны операционными проблемами, а не алгоритмическими недостатками. Одна 18-часовая контролируемая тонкая настройка показала 99% точности токенов, но фактическая метрика оценки, точность множественного выбора, осталась неизменной. Это произошло из-за контроля рассуждений в свободном тексте при оценке одного извлеченного ответа, что демонстрирует дрейф прокси-метрики. Тренер GRPO вышел из строя, потому что две библиотеки не согласились по поводу длины последовательности, причем токены дополнения изображений были подсчитаны дважды, что указывает на ошибки интеграции на границах компонентов. Автор узнал, что такие "обходные пути" требуют дешевых регрессионных тестов для предотвращения тихого повторного внедрения ошибок. Значительный цикл обучения с подкреплением демонстрировал плоское обучение в течение длительного периода, что в конечном итоге было связано с шумом меток в конвейере вознаграждения и инвертированным сигналом преимущества. Эта "тихая" неудача не привела к сбоям, а лишь к отсутствию обучения, подчеркивая необходимость тщательной проверки вычисления вознаграждения. Этот опыт привел к созданию важнейших "правил оснастки" для всех тренировочных запусков. Они включают проведение дымовых тестов перед выделением вычислительных ресурсов, обеспечение того, чтобы запуски были закрыты при сбое, чтобы ни один незарегистрированный запуск не мог быть ошибочно принят за зарегистрированный, и строгое разделение сбоев инфраструктуры от плохой производительности модели. Критически важно, что только метрика оценки, выделенная для проверки, считается истинным решающим фактором, а все остальные метрики служат лишь телеметрией. Автор подчеркивает, что эти "скучные" правила необходимы для получения надежных результатов.