AWS, AWS에서 AI 에이전트용 오픈 소스 벤치마크인 aws-bench를 발표합니다.
오늘 AWS는 실제 AWS 작업을 AI 에이전트가 얼마나 정확하고 효율적으로 완료하는지 측정하는 오픈 소스 벤치마크인 aws-bench의 연구 미리보기를 발표합니다. AWS 인프라에서 작동하는 에이전트를 구축하는 모델 제공업체 및 AI 연구원은 성능을 측정하고 실패를 진단할 수 있는 객관적이고 재현 가능한 방법이 필요합니다. aws-bench는 조사, 문제 해결 및 인프라 생성 작업을 포함하여 실제 AWS 사용 분석에서 파생된 공개 테스트 사례 모음을 제공합니다. 각 테스트 사례는 자연어 쿼리와 정의된 클라우드 리소스 상태 및 정답을 쌍으로 이루므로 일관되고 검증 가능한 기준으로 모든 에이전트 또는 모델의 점수를 매길 수 있습니다. 연구원 및 모델 제공업체는 aws-bench를 사용하여 AWS 작업에 대한 기반 모델 성능을 개선하고, 에이전트 하네스를 개선하며, 개선 진행 상황을 추적할 수 있습니다. 릴리스에는 테스트 환경을 인스턴스화하고, 평가 실행을 실행 및 채점하며, 리소스 상태를 재설정할 수 있는 사용하기 쉬운 CLI 도구가 포함되어 있습니다. aws-bench는 현재 GitHub에서 사용할 수 있습니다. 시작하려면 README의 설정 지침을 따르십시오.