RAG推論コストを6倍削減するには、LLMに到達させないもの... ノート
VentureBeat 日本語

RAG推論コストを6倍削減するには、LLMに到達させないものを決定することから始まります。

高リスク分類のためのほとんどの検索拡張生成(RAG)システムは、誤ってすべての曖昧なケースを直接大規模言語モデル(LLM)にルーティングしており、これは監査や精査の下で失敗します。著者は、誤った回答が重大な結果をもたらす規制されたエンタープライズ環境において、監査可能性、コスト、および一貫性を重視する、異なる設計哲学を提唱しています。すべてLLMのパイプラインは、目に見えないコストを発生させます。それは、意思決定の監査の難しさ、大規模での高い推論コストとレイテンシ、そして決定論的であるべきケースでの一貫性のないパフォーマンスです。カスケードアーキテクチャは、LLMを最前線ではなくエスカレーションパスとして扱うことで、これらの問題に対処します。ステージ1は決定論的であり、ルールと完全一致で明確なケースを解決し、LLM呼び出しなしで大部分のボリュームをクリアし、完全な説明可能性を保証します。ステージ2は、ステージ1で解決されなかったケースに対して検索レイヤーを採用し、過去の決定やコンテキストドキュメントのような特定の証拠をプルします。検索品質が最重要です。ステージ3はLLM呼び出しであり、ステージ1とステージ2で解決できなかった真に曖昧なケースにのみ予約されています。このアプローチは、推論コストを大幅に削減し、決定論的なケースでの一貫性を向上させます。LLMステージでは、異なるエラータイプのコストは等しくないことを認識する非対称リスクプロンプトが重要です。これは、モデルに不確実性をエスカレートするように指示し、結果を伴う調整された例を提供し、分類と並んで信頼度スコアを要求することを意味します。信頼度スコアは、第2のカスケードポイントとして機能し、低信頼度のケースを人間のレビュー担当者にルーティングします。このようなシステムの評価には、特定の調整が必要です。検索品質は、最終的な分類精度とは独立して測定する必要があり、評価セットはステージ3のケースをオーバーサンプリングする必要があります。LLMをジャッジとする評価は、ジャッジプロンプトが同じ非対称リスクフレーミングを組み込んでいる場合に効果的です。最後に、確認された結果から検索コーパスへのフィードバックループは、曖昧なケースの処理における継続的な改善に不可欠です。より広範な教訓は、高リスクドメインでは、意思決定のどの部分が決してモデルを含めるべきではないかを決定することに、価値のあるエンジニアリング作業があるということです。
CdXz5zHNQW_U4g6f1Ap20.png