"동일한 벤치마크에 대한 두 개의 "Codex CLI"... 노트

"동일한 벤치마크에 대한 두 개의 "Codex CLI" 모델: 하네스가 모델을 숨김"

Specific Labs의 Real-SWE 벤치마크는 코딩 에이전트 평가에 있어 치명적인 문제를 드러냅니다. "Claude Code" 또는 "Codex CLI"와 같은 모델 이름은 실제 AI 모델이 아닌 하네스를 나타내므로 오해의 소지가 있습니다. 동일한 하네스라도 통합된 모델에 따라 성능이 크게 달라질 수 있습니다. 예를 들어, Codex CLI의 GPT-6 Astra는 33.8%의 해결률을 달성했지만, 동일한 하네스의 GPT-5.6 Sol은 16.2%에 불과했습니다. 이 두 배 이상의 차이는 하네스가 사고를 수행하는 구성 요소가 아니라 단순히 라우팅 계층임을 강조합니다.마찬가지로, Claude Code의 Fable 5.1은 38.8%를 기록한 반면, Claude Code의 GLM 5.3은 28.8%를 기록하여 10점의 차이를 보였습니다. Real-SWE는 모델과 하네스의 조합으로 결과를 올바르게 제시하며, 이는 종종 공급업체가 자체 도구에서 불리한 수치가 나올 수 있다는 이유로 피하는 정직한 관행입니다. 코딩 에이전트를 찾는 팀에게 단순히 "Claude Code 사용"은 에이전트의 실제 기술에 대한 통찰력을 제공하지 못합니다. 모델 교체가 가장 중요한 성능 레버이지만, 대부분의 마케팅에서는 숨겨져 있습니다.벤치마크 점수를 검토할 때는 사용된 모델과 하네스를 모두 식별하는 것이 중요합니다. 필수적인 세부 정보에는 컨벤션, 컨텍스트 전달, 도구 루프 및 판사가 포함됩니다. 공급업체가 점수와 연결된 특정 모델 공개를 꺼리는 것은 위험 신호여야 합니다. 스캐폴드, 즉 하네스는 에이전트의 실제 추론 능력보다 점수에 더 큰 영향을 미칠 수 있습니다.