評価駆動開発:大規模なGenAIの評価から得られた教訓
Airbnbは、信頼性の高い生成AI製品を構築するための重要なエンジニアリング規律として評価を捉えることを重視しています。LLM出力の非決定的かつ主観的な性質により、従来のソフトウェアテストの仮定は覆され、しばしばAIがAIを評価することが求められます。AirbnbのプロダクトチームはLLM搭載機能を構築し、インフラストラクチャチームがツールとベストプラクティスを提供してサポートしています。基本的な原則は、誤った自信や検出されないリグレッションを避けるために、最初から評価を計画する必要があることを理解することです。「一つのルール」は、データを手動でレビューし、プロトタイプ出力を調べることで成功のための直感を構築することです。この習慣は、失敗モードが発見され、エンコードされ、継続的にテストされる評価駆動開発へと進化します。評価駆動開発の主要な原則には、目標の定義、実際の誤差をメトリクスに導かせること、小さくシャープな評価者セットの使用、意思決定者の任命、継続的なコラボレーションが含まれます。3つの評価方法がレイヤーを形成します。明白な失敗に対するプログラムによるチェック、ニュアンスのある品質のためのLLM-as-a-Judge、そしてエッジケースと検証のための人間の評価です。プログラムによるチェックは決定的コードベースのテストを使用しますが、LLM-as-a-Judgeはルーブリックに対してより強力なLLMを採用し、信頼性のためにキャリブレーションが必要です。人間の評価は、グラウンドトゥルースと高リスクの決定のためのゴールドスタンダードとして機能します。エージェンティックシステムの場合、評価は複数のレイヤーに及び、最終出力だけでなく、推論パスとツール呼び出しを調べます。実践的なウォークスルーは、初期の失敗の探索、プログラムによるチェックとキャリブレーションされた仮想ジャッジによるレイヤード評価の構築、そして本番環境での監視によるスケーリングを示しています。主要なテイクアウェイは、データを見ること、一般的なメトリクスを避けること、小さく始めること、ジャッジをキャリブレーションすること、レイヤード防御を使用すること、そして本番環境での評価をミラーリングすることの重要性を強調しています。最終的に、成功するAI製品開発は、評価が製品の成功の定義を形作る共同のチームスポーツであることに依存します。