하네스 엔지니어링의 해부학: AI 코딩 에이전트를 평가... 노트

하네스 엔지니어링의 해부학: AI 코딩 에이전트를 평가, 반복, 보호하는 방법

SWE-bench와 같은 엔드투엔드 벤치마크는 AI 에이전트에 대한 광범위한 성능 점수를 제공하지만, 종종 비용이 많이 들고 느리며 에이전트의 로직이 정확히 어디에서 실패했는지 설명하는 데 필요한 근본 원인 진단이 부족합니다. 이를 해결하기 위해 개발자는 최종 문자열 일치보다는 특정 도구 호출 또는 파일 수정 확인과 같은 개별 중간 작업에 대해 주장하는 빠르고 로컬이며 단위 스타일의 테스트인 행동 평가를 채택해야 합니다. 이러한 저렴한 마이크로 체크를 매크로 벤치마크와 함께 구축함으로써 엔지니어링 팀은 회귀 위험 없이 시스템 프롬프트를 자신 있게 반복하고 모델을 업그레이드할 수 있습니다.