99% 토큰 정확도, 학습 제로. RL로 비전 모델을 ... 노트

99% 토큰 정확도, 학습 제로. RL로 비전 모델을 미세 조정한 필드 노트.

저자는 비전-언어 모델의 미세 조정을 경험한 내용을 설명하며, 많은 실패가 알고리즘적 결함보다는 운영상의 문제에서 비롯되었음을 강조합니다. 18시간 동안 진행된 지도 미세 조정은 99%의 토큰 정확도를 보였지만, 실제 평가 지표인 객관식 정확도는 변하지 않았습니다. 이는 자유 형식 텍스트 추론을 지도하면서 단일 추출된 답변을 평가했기 때문이며, 프록시 지표 드리프트(proxy metric drift)를 보여줍니다. GRPO 트레이너는 두 라이브러리가 시퀀스 길이에 대해 동의하지 않아 충돌했으며, 이미지 패드 토큰이 두 번 계산되어 구성 요소 경계에서의 통합 버그를 지적했습니다. 저자는 이러한 몽키패치(monkeypatch)에는 버그가 조용히 재도입되는 것을 방지하기 위한 저렴한 회귀 테스트가 필요하다는 것을 배웠습니다. 상당한 RL 루프는 장기간 동안 평탄한 학습을 보였는데, 이는 결국 보상 파이프라인의 레이블 노이즈와 반전된 어드밴티지 신호(inverted advantage signal)로 추적되었습니다. 이 "조용한" 실패는 충돌 없이 학습의 부재만을 보여주었으며, 보상 계산에 대한 철저한 감사의 필요성을 강조했습니다. 이러한 경험은 모든 훈련 실행에 대한 중요한 "하네스 규칙(harness rules)"으로 이어졌습니다. 여기에는 컴퓨팅을 커밋하기 전에 스모크 테스트(smoke tests)를 수행하고, 점수 없는 실행이 점수 있는 실행으로 오인되지 않도록 실행이 실패 시 닫히도록(fail-closed) 게이트를 설정하며, 인프라 실패와 모델 성능 저하를 엄격하게 분리하는 것이 포함됩니다. 결정적으로, 보유된 평가 지표만이 진정한 결정자로 간주되며, 다른 모든 지표는 단순한 원격 측정(telemetry)으로 사용됩니다. 저자는 이러한 "지루한" 규칙이 신뢰할 수 있는 결과를 얻는 데 필수적이라고 강조합니다.