아르민 로나허: 더 나은 모델: 더 나쁜 도구들
최근 Anthropic 모델, 특히 Opus 4.8과 Sonnet 5에서 Pi의 편집 도구에 대한 특이한 문제가 나타나고 있습니다. 이 고급 모델들은 중첩된 편집 배열 내에 추가적인, 만들어낸 필드를 포함하는 도구 호출을 생성하는 경우가 있습니다. 핵심 편집 작업은 보통 올바르지만, 이러한 불필요한 인수는 스키마 불일치로 인해 Pi가 도구 호출을 거부하게 만듭니다. 이 문제는 이전 모델에 비해 최신, 최첨단 모델에서 더 흔하게 발생합니다.도구 호출은 본질적으로 API가 해석하는 텍스트 기반 신호이며, 마법적인 과정이 아닙니다. 모델은 특정 형식으로 훈련되며 시스템이 특정 인수로 도구를 호출하는 명령으로 인식하는 텍스트를 출력합니다. 텍스트는 파일 경로와 편집에 대한 특정 페이로드 구조를 예상하는 편집 도구를 설명합니다. 제약 조건이 없으면 모델은 이러한 도구 호출을 생성하기 위해 학습된 관습에 의존합니다.실패는 모델이 편집 객체에 "requireUnique" 또는 "oldText2"와 같은 만들어낸 키를 추가하는 형태로 나타납니다. 편집될 실제 텍스트가 올바르더라도 이러한 조작된 필드는 유효성 검사 오류를 유발합니다. 이 문제는 컨텍스트에 따라 다르며, 간단한 단일 턴 프롬프트보다는 광범위한 대화가 포함된 에이전트 기록에서 자주 발생합니다. 테스트에서 엄격한 도구 호출을 사용하면 실패율이 크게 줄어들거나 제거된다는 점이 언급되었습니다.저자는 이러한 회귀가 훈련 아티팩트라고 가정하며, 최신 모델이 Claude Code의 내부 하네스와 유사한 환경에서 훈련되었다고 제안합니다. 이 하네스는 잘못된 도구 호출을 재시도하거나 알 수 없는 키를 필터링하여 처리하는 등 매우 관대합니다. 이 관대한 환경은 핵심 작업이 완료되면 불필요한 필드를 추가하는 것이 허용된다는 것을 모델에게 의도치 않게 가르칠 수 있습니다. 이러한 훈련은 특정 도구 스키마에 대한 강력한 사전 지식을 생성하여 모델이 Pi와 같은 다른 또는 더 엄격한 스키마 정의에 덜 적응하게 만들 수 있습니다."Slop Harness"는 Claude Code의 관대한 특성을 지칭하며, 누출된 마크업 처리, 유니코드 시퀀스 복구, 매개변수 별칭 수락과 같은 기능을 포함합니다. 또한 예상치 못한 키를 조용히 삭제하고 자체 복잡성 제한이 있는 엄격한 모드를 피합니다. 저자는 도구 스키마가 Anthropic 모델에 대해 중립적이지 않을 수 있으며, 모델이 특정, 문서화되지 않은, 관대한 도구 생태계에서 벗어나는 것에 대해 암묵적으로 불이익을 받을 수 있다고 우려를 표합니다. 이는 다양한 도구 모양에 더 잘 적응하는 것으로 보이는 Codex와 같은 모델과 대조됩니다. 이 문제는 특정 환경에서의 강화 학습이 모델 행동을 예상치 못한 방식으로 형성할 수 있음을 강조합니다.