再評価されないAzure Databricksデータエージェントは、監視されていない本番モデルです。
MLモデルは、評価なしでは時間の経過とともに劣化します。これは、会話データエージェントではしばしば見過ごされる問題です。Genie Ontologyは、特にGenie Agent Benchmarksを通じて、エージェントを継続的に評価および改善することで、この問題に対処します。ベンチマークには、個別の会話が含まれ、質問の種類に応じて2つのモードのいずれかで評価されます。チャットモードでは、エージェントが生成したSQLまたはその結果を「正解」の回答と比較し、「良い」結果と「悪い」結果に対して客観的なルールが適用されます。エージェントモードは、複数ステップのテキストベースの推論レポート用であり、LLMジャッジが応答をオプションの評価ノートと比較して評価します。チャットモードの重要な設計上の詳細は、正当なバリエーションを報酬として与えながら構造的なエラーをフラグ付けする能力であり、ベンチマークへの信頼を育みます。ベストプラクティスでは、包括的なテストを保証するために、ビジネス上の質問ごとに2〜4のフレーズバリエーションを登録することが推奨されています。ベンチマークの実行後、Genie Codeは結果を分析し、特定されたギャップに対処するための指示またはコンテキストの調整を提案します。この「バッチレビュー」は、実際の使用データにも適用され、プロアクティブな問題解決を可能にします。ただし、ユーザーフィードバックはエージェントの動作を自動的に変更しないため、人間のレビューは不可欠です。正解SQLの品質も重要であり、ツールは長期的な精度トレンドを内部に保存しません。ベンチマークへの初期投資は、変更を効率的に検証し、エージェントの継続的な信頼性を確保するために不可欠です。