複数のAIモデルを使用している企業は、障害率を2.25倍過小... ノート
VentureBeat 日本語

複数のAIモデルを使用している企業は、障害率を2.25倍過小評価している

新しい研究によると、互いの盲点を補うために複数のAIモデルを組み合わせることは、数学的に欠陥があり、この現象は「コフェイラーシーリング(co-failure ceiling)」と名付けられました。この欠陥は、モデルがどれだけ頻繁に意見が一致しないかではなく、すべてのモデルが同時に失敗するプロンプトの割合によってパフォーマンスが制限されることを意味します。企業は、このシーリングを無視して、存在しないパフォーマンス向上を追い求めて高価なルーティングインフラストラクチャを構築しています。ルーター、カスケード、Mixture-of-Agents(MoA)のようなオーケストレーションアーキテクチャは、レイテンシやメンテナンスなどの隠れたコストを発生させます。モデルを選択するために低い「ペアワイズエラー相関(pairwise error correlation)」に頼ることは、モデルの能力が均等でない場合、弱いモデルがより強いモデルを打ち負かす可能性があるため、パフォーマンスを損なう可能性があります。専門家は、同等の品質のモデルのみを組み合わせるか、品質が一致しない場合は単一の最良のモデルに留まることを推奨しています。MoAアーキテクチャは、多様で同等の品質のモデルを組み合わせる場合に有望ですが、ペアワイズ相関は絶対的なシステム精度を予測できません。根本的な問題は、ルーティングのインテリジェンスに関係なく、すべてのモデルが同時に失敗する、不明瞭で複雑なエッジケースを表す「コフェイラー率(co-failure rate)」です。「共通モード原子(common-mode atoms)」またはモデル間の共有された失敗点によって駆動される標準的な相関メトリックは、このコフェイラー率を大幅に過小評価します。タスク形式もコフェイラーに影響を与え、オープンエンドの生成タスクは、すべての間違いのテールを拡大します。開発者は、生成を検証または制約付き選択に変換することで、これを克服できます。クローパー・ピアソン境界(Clopper-Pearson bound)を使用したコストのかからない展開前の健全性チェックは、少量のデータセットを使用して楽観的な精度仮定を修正することにより、絶対的なパフォーマンスシーリングを予測できます。このチェックは、企業が追加のクエリコストを発生させることなく、マルチモデルオーケストレーションが本当に価値があるかどうかを判断するのに役立ちます。明確にチェックされたタスクの場合、非常に強力なクエリレベルのルーティング信号が存在しない限り、単一の最良のモデルを使用することが、複数のモデルを組み合わせるよりも優れたパフォーマンスを発揮することがよくあります。
CdXz5zHNQW_8lt4YzUcPH.jpeg