코딩 에이전트에게 더 많은 시간을 준다고 해서 별 도움이 되지 않습니다
Real-SWE는 라이선스된 비공개 기업 코드베이스(청구, 세금, 다중 서비스 작업)를 대상으로 프론티어 모델을 실행했으며, 한 가지 숫자가 눈에 띄었습니다. 롤아웃 기간이 해상도에 거의 영향을 미치지 않았습니다.10분 이내에 완료된 롤아웃의 71.4%가 실패했습니다. 10분 이상 실행된 롤아웃의 73.4%도 실패했습니다. 어느 쪽이든 통과율은 27-29%로 평탄했습니다. 실행 시간을 몇 분에서 긴 롤아웃으로 연장하는 것은 결과에 약 2% 포인트의 변화를 주는데, 이는 노이즈입니다.선두 주자인 Fable 5.1 on Claude Code는 38.8%의 해상도만 달성했습니다. GPT-6 Astra on Codex CLI는 33.8%를 달성했습니다. 최고 모델조차도 여전히 약 10개의 비공개 기업 작업 중 6개를 실패합니다.이것이 공급업체 데모에서 건너뛰는 부분입니다. 쉬운 문제는 빠르게 해결되므로 짧은 롤아웃에서는 높은 처리량이 나타납니다. 그러나 중요한 작업, 즉 실제 급여, 세금 및 통합 코드에 숨겨진 작업은 구조적인 벽에 부딪힙니다. 에이전트는 해당 작업에서 컴퓨팅 성능이 부족한 것이 아닙니다. 이해력이나 컨텍스트가 부족하거나, 하네스가 올바른 진입점을 제공하지 못하는 것입니다. 추가 10분의 반복적인 재시도는 이러한 문제를 해결하지 못합니다.Real-SWE가 올바르게 처리하는 또 다른 점은 각 점수를 모델 단독이 아닌 모델+하네스로 취급하는 것입니다. Fable 5.1은 Claude Code의 스캐폴드와 결합했을 때 38.8%에 불과합니다. 이것은 비공개 코드에 대한 하네스 결과이지, 진공 상태의 모델에 대한 진술이 아닙니다. 너무 많은 리더보드가 여전히 하네스가 고정되지 않은 모델 이름을 게시하고, 사람들은 완전히 다른 스캐폴딩 간에 비교하고 잘못된 결론을 내립니다.에이전트를 구매하는 모든 사람을 위한 팁: 공급업체가 통과율을 보여줄 때, 해당 숫자가 어떤 부분에서 나왔는지 물어보십시오. 빠르고 얕은 작업을 통과하기 때문에 훌륭해 보이는 모델은 실제로 해결해야 하는 정확한 세트를 숨기고 있습니다.벤치마크 출처: withspecific.com/benchmarks/real-swe