다수의 AI 모델을 사용하는 기업은 실패율을 2.25배... 노트

다수의 AI 모델을 사용하는 기업은 실패율을 2.25배 과소평가하고 있습니다.

새로운 연구에 따르면, 서로의 맹점을 보완하기 위해 여러 AI 모델을 결합하는 것은 수학적으로 결함이 있으며, 이는 "공동 실패 천장(co-failure ceiling)"이라고 불리는 현상입니다. 이 결함은 성능이 모델들이 얼마나 자주 의견이 일치하지 않는지에 의해 제한되는 것이 아니라, 모든 모델이 동시에 실패하는 프롬프트의 비율에 의해 제한된다는 것을 의미합니다. 기업들은 이 천장을 무시하고 존재하지 않는 성능 향상을 쫓아 값비싼 라우팅 인프라를 구축하고 있습니다. 라우터, 캐스케이드, Mixture-of-Agents(MoA)와 같은 오케스트레이션 아키텍처는 지연 시간 및 유지 보수를 포함한 숨겨진 비용을 발생시킵니다. 모델을 선택하기 위해 낮은 "쌍별 오류 상관관계(pairwise error correlation)"에 의존하는 것은 모델들이 동등하게 능력이 있지 않다면 성능을 저해할 수 있으며, 약한 모델이 강한 모델을 투표로 이길 수 있습니다. 전문가들은 품질이 일치하는 모델만 결합하거나, 품질을 맞출 수 없다면 단일 최고 모델을 고수할 것을 권고합니다. MoA 아키텍처는 다양하고 품질이 일치하는 모델을 결합할 때 유망해 보이지만, 쌍별 상관관계는 절대 시스템 정확도를 예측하는 데 실패합니다. 핵심 문제는 라우팅 지능에 관계없이 모든 모델이 함께 실패하는 모호하고 복잡한 엣지 케이스를 나타내는 공동 실패율입니다. 표준 상관관계 지표는 "공통 모드 원자(common-mode atoms)" 또는 모델 간 공유되는 실패 지점에 의해 주도되는 이 공동 실패율을 상당히 과소평가합니다. 작업 형식 또한 공동 실패에 영향을 미치며, 개방형 생성 작업은 모든 것이 틀린 꼬리 부분을 확장합니다. 개발자는 생성을 검증 또는 제약된 선택으로 변환함으로써 이를 극복할 수 있습니다. Clopper-Pearson 경계를 사용하는 비용 없는 배포 전 건전성 검사는 소규모 데이터셋을 사용하여 낙관적인 정확도 가정을 수정함으로써 절대 성능 천장을 예측할 수 있습니다. 이 검사는 기업이 추가적인 쿼리 비용을 발생시키지 않고 다중 모델 오케스트레이션이 실제로 수익성이 있을지 여부를 결정하는 데 도움이 됩니다. 명확하게 확인된 작업의 경우, 매우 강력한 쿼리 수준 라우팅 신호가 존재하지 않는 한, 단일 최고 모델을 사용하는 것이 여러 모델을 결합하는 것보다 종종 더 나은 성능을 보입니다.
CdXz5zHNQW_8lt4YzUcPH.jpeg