99% 的 token 准确率,零学习。关于使用 RL 微调视觉模型的田野笔记。
作者回顾了微调视觉 - 语言模型的经历,指出许多失败源于操作问题而非算法缺陷。一次 18 小时的监督微调显示 token 准确率达到 99%,但实际评估指标——多项选择题准确率——却未发生变化。这是因为监督过程针对自由文本推理,而评估仅针对提取出的单一答案,体现了代理指标漂移。一个 GRPO 训练器因两个库在序列长度上存在分歧而崩溃,图像填充 token 被重复计数,暴露了组件边界处的集成缺陷。作者认识到,此类 monkeypatches 需要廉价的回归测试,以防止错误被静默重新引入。一个显著的强化学习循环在较长时间内呈现学习停滞,最终被追溯至奖励管道中的标签噪声以及优势信号反转。这种“安静”的失败没有崩溃,仅表现为学习缺失,凸显了对奖励计算进行彻底审计的必要性。这些经验促成了所有训练运行必须遵循的关键“训练器规则”:在提交计算资源前执行冒烟测试;确保运行采用故障关闭的门控机制,防止未评分的运行被误判为已评分;严格区分基础设施故障与模型性能不佳。至关重要的是,仅保留的评估指标被视为真正的裁决者,其余指标仅作为遥测数据。作者强调,这些“枯燥”的规则对于获得可信结果至关重要。