数週間から1日に:LLM評価をイテレーションに十分な速さで実現する方法
プロダクション言語モデルシステムを出荷するには、改善の迅速なイテレーションが必要ですが、モデルと評価プロセスの非決定的な性質により、これは困難です。Airbnbは、エンジニアリングの強化と統合に焦点を当て、4つのレイヤーにわたる信頼性の高いLLMインフラストラクチャを構築することで、これらの課題に対処しました。コア原則は、コンポーネント間の継ぎ目に問題が発生し、包括的なエンドツーエンドテストが不可欠であるということです。レイヤー1は、データと判断の不確実性の違いを区別して、パフォーマンスの変動を理解するために、評価ノイズの診断フレーミングに焦点を当てています。LLM評価におけるノイズは、ジャッジが異なる入力にスコアを付けたり、LLMによって生成された参照が変更されたりすることから生じる可能性があり、真のモデルの改善を識別することを困難にします。認識論的不確実性(モデル/ジャッジの限界)と偶発的不確実性(タスクの曖昧さ)を分離することが、正確な診断の鍵となります。レイヤー2は、ジャッジへの入力を安定させることで、決定的な評価基盤を確立します。これは、参照とジャッジスコアのサンプルごとのキャッシュによって実現され、同一の入力がキャッシュされた結果をもたらし、評価を再現可能で効率的にします。この決定的な測定は、レイヤー1の診断機能に不可欠です。レイヤー3は、マイクロアダプターを介して、境界付けられたスコープ付きのモデル変異を可能にします。これらは、特定のバグでトレーニングされた小さなLoRAパッチであり、迅速な1時間トレーニングとホットフィックススタイルのデプロイメントを可能にします。3つのライフサイクルルール(共同トリガーパッチの融合、蓄積による再トレーニング、未使用パッチのアンロード)は、アダプターのスタックが劣化するのを防ぎます。レイヤー4は、システムの継ぎ目でエンドツーエンドの検証を提供します。個々のコンポーネントは問題なく見えても、それらの相互作用が予期しない動作を引き起こす可能性があります。このレイヤーには、結合された品質とレイテンシを測定するために、代表的な入力をシステム全体のプロダクションパスで実行することが含まれ、デプロイ前に継ぎ目のバグが表面化されることを保証します。これらの4つのレイヤーは依存関係スタックを形成し、各レイヤーの有効性は他のレイヤーに依存します。