在 Databricks 上部署带有 RAG、MLflow、... 笔记

在 Databricks 上部署带有 RAG、MLflow、向量搜索和模型服务的企业级 LLM 聊天机器人

演示总是能成功。有人在笔记本中将向量索引连接到基础模型,就员工手册提出三个问题,得到三个清晰的回答,全场点头认可。随后需求变为“部署给 4000 名员工”,而那个笔记本便悄然失效。没有端点、没有身份验证、没有版本历史、无法查看特定回答为何出错,当法务询问如何回滚那个开始引用 2019 年 PTO 政策的提示词时,你也无法给出任何解释。我曾目睹多个团队在此处碰壁。RAG 部分——分块、嵌入、检索、填充上下文、生成——他们理解得相当透彻。他们缺失的是枯燥的一半:如何将运行在笔记本单元格中的链式流程,转化为一个受管制的、可版本控制的、可监控的 REST 端点,供聊天界面调用;使其能在凌晨三点的紧急呼叫中依然稳定运行;并能在下个月进行 A/B 测试而无需重新部署整个系统?本文正是关于这一枯燥的一半。我们将假设您已在概念上理解 RAG,并完整走通 Databricks 的路径:编写链式流程、将其日志记录至 MLflow、注册到 Unity Catalog、部署到模型服务端点、追踪每一次检索与生成,并在上线后对其进行运维。