从数周缩短至一天:我们如何让大语言模型评估快得足以支持快速迭代
将生产级语言模型系统上线需要快速迭代改进,但由于模型和评估过程的非确定性,这一挑战尤为突出。Airbnb 通过构建覆盖四个层面的可靠 LLM 基础设施,聚焦工程优化与集成,以应对这些挑战。其核心原则是:组件间的接口处最容易出现问题,因此全面的端到端测试至关重要。第一层专注于评估噪声的诊断性框定,区分数据噪声与判断不确定性,以理解性能波动。LLM 评估中的噪声可能源于评分者对输入的不同打分,或 LLM 生成的参考答案发生变化,从而难以辨别模型真正的改进。准确诊断的关键在于区分认识性不确定性(模型/评分者的局限性)与偶然性不确定性(任务本身的歧义)。第二层通过稳定输入给评分者,建立确定性的评估基础。这通过为每个样本缓存参考答案和评分实现,确保相同输入始终返回缓存结果,从而使评估可复现且高效。这种确定性测量是第一层诊断能力得以实现的前提。第三层通过微适配器实现有界、范围受限的模型突变。这些是仅在特定缺陷上训练的小型 LoRA 补丁,支持快速(约一小时)训练及类似热修复的部署。为防止适配器堆栈性能退化,需遵循三条生命周期规则:融合并发触发的补丁、在累积数据上重新训练、以及卸载未使用的补丁。第四层在系统接口处提供端到端验证。尽管各组件单独表现正常,但其交互仍可能导致意外行为。该层面涉及将代表性输入运行于整个生产路径,以衡量综合质量与延迟,确保在部署前暴露接口处的缺陷。这四个层面构成一个依赖栈,每一层的有效性均依赖于其他层面。