一个从未被重新评估的 Azure Databricks 数据... 笔记

一个从未被重新评估的 Azure Databricks 数据代理是一个没有监控的生产模型。

ML 模型若缺乏评估,会随时间推移而性能退化,这一问题在对话数据代理中常被忽视。Genie 本体(Genie Ontology)通过 Genie 代理基准(Genie Agent Benchmarks)持续评估并改进代理。基准测试包含隔离的对话,每场对话根据问题类型在两种模式之一中进行评估。Chat 模式将代理生成的 SQL 或其结果与“真实答案”(ground truth)进行对比,并依据客观规则判定结果为“良好”或“不佳”。Agent 模式适用于多步骤、基于文本的推理报告,由 LLM 裁判对照可选的评估说明对响应进行评判。一个关键的设计细节是 Chat 模式能够奖励合法的变体,同时标记结构性错误,从而增强对基准测试的信任。最佳实践建议为每个业务问题注册两到四种措辞变体,以确保全面测试。基准测试运行后,Genie Code 会分析结果,提出指令或上下文的调整建议,以解决已识别的差距。这种“批量审查”同样适用于真实使用数据,从而实现主动的问题解决。然而,人工审查至关重要,因为用户反馈不会自动改变代理行为。真实答案 SQL 的质量也至关重要,且该工具不内部存储长期的准确性趋势。从第一天起就投入基准测试,对于高效验证变更并确保代理的持续可靠性至关重要。