使用多个 AI 模型的企业低估了 2.25 倍的失败率
一项新研究揭示,将多个 AI 模型组合以覆盖彼此的盲点在数学上是存在缺陷的,这一现象被称为“共失效上限”(co-failure ceiling)。该缺陷意味着性能的提升并非取决于模型分歧的频率,而是取决于所有模型同时失效的提示比例。企业正通过忽视这一上限,构建昂贵的路由基础设施,追逐并不存在的性能增益。诸如路由器、级联架构和智能体混合(Mixture-of-Agents, MoA)等编排架构引入了隐性成本,包括延迟和维护开销。若模型能力不相等,仅依赖较低的“成对错误相关性”来选择模型可能会损害性能,因为较弱模型可能压倒较强模型。专家建议,仅组合质量匹配的模型,或在无法匹配质量时坚持使用单一最佳模型。尽管 MoA 架构在组合多样化且质量匹配的模型时展现出前景,但成对相关系数无法预测系统的绝对准确率。核心问题在于共失效率,它代表了无论路由智能如何,所有模型都会共同失效的那些隐蔽且复杂的边缘情况。标准的相关性指标会显著低估这一共失效率,其驱动因素是模型间共享的“共模原子”(common-mode atoms)或失效点。任务格式也会影响共失效,开放式生成任务会扩大全错尾部。开发者可通过将生成任务转化为验证或约束选择来克服这一问题。一种无需成本的部署前健全性检查,利用 Clopper-Pearson 界限,可基于小数据集预测绝对性能上限,从而纠正过于乐观的准确率假设。该检查有助于企业判断多模型编排是否真正值得投入,而无需承担额外的查询成本。对于经过明确验证的任务,除非存在极强的查询级路由信号,否则使用单一最佳模型通常优于组合多个模型。