Qwen 3.8-Max와 Claude Opus 5는 왜... 노트

Qwen 3.8-Max와 Claude Opus 5는 왜 단순 벤치마크 점수가 비용을 예측하지 못하는지를 보여줍니다.

알리바바의 새로운 Qwen 3.8-Max는 상반된 성능 결과를 보여주고 있으며, 알리바바는 Claude Fable 5에 이어 두 번째라고 주장하는 반면, 독립적인 벤치마크에서는 중간 수준으로 평가하고 있습니다. 이러한 불일치는 테스트에 사용된 토큰 및 시간 예산의 차이에서 비롯됩니다. 알리바바의 벤치마크는 훨씬 더 긴 타임아웃을 사용하여 더 나은 점수를 설명합니다.이 글은 토큰당 가격이 추론 모델을 평가하는 데 불충분한 지표라고 주장합니다. 대신, 실패한 시도를 포함한 모든 비용을 성공적으로 완료된 작업으로 나눈 "성공 작업당 비용" 지표를 제안합니다. 이 접근 방식은 모델 효율성과 비용에 대한 보다 현실적인 시각을 제공합니다.또한, 이 글은 실패율이 구성 설정, 특히 시간 또는 토큰 예산에 의해 크게 영향을 받는다는 점을 강조합니다. 벤치마크는 종종 완전히 잘못된 답변과 단순히 시간 초과된 작업 간의 구분을 하지 못하며, 예산 소진이 실패의 주요 원인입니다. 실패 이유에 대한 더 명확한 보고가 필요하다고 제안합니다.저자들은 시간 또는 토큰 예산을 숨겨진 세부 사항이 아닌 명시적인 수락 기준으로 만들어야 한다고 주장합니다. 이는 성공 없이 속도를 최적화하는 것이 비용 증가와 좋지 않은 결과로 이어질 수 있기 때문에 효과적인 에이전트 시스템을 구축하는 데 중요합니다. 이미 여러 조직에서 성공 작업당 비용 지표를 채택하고 있습니다.모델 평가를 개선하기 위해 실패 이유를 별도로 출력하고, 노력 수준별 성공 작업당 비용을 계산하며, 지연 시간이 중요하지 않은 한 벽시계 시간 대신 토큰으로 제한할 것을 권장합니다. 마지막으로, 배포된 모델의 기본 노력 설정을 확인하는 것이 좋습니다. 높은 노력 설정이 항상 더 나은 결과를 가져오는 것은 아니기 때문입니다.
CdXz5zHNQW_gokBEm64di.png