RAG, MLflow, Vector Search 및 Model Serving을 사용하여 Databricks에 엔터프라이즈 LLM 챗봇 배포
데모는 항상 작동합니다. 누군가가 노트북에서 파운데이션 모델에 벡터 인덱스를 연결하고, 직원 핸드북에 대해 세 가지 질문을 하여 세 가지 명확한 답변을 얻으면 방 안에서 고개를 끄덕입니다. 그런 다음 요청은 "4,000명의 직원에게 배포해달라"가 되고, 노트북은 조용히 죽습니다. 엔드포인트도 없고, 인증도 없고, 버전 기록도 없고, 특정 답변이 왜 틀렸는지 볼 방법도 없고, 법무팀이 2019년 PTO 정책을 인용하기 시작한 프롬프트를 어떻게 롤백할 것인지 물을 때 설명할 이야기도 없습니다.저는 여러 팀이 이 벽에 부딪히는 것을 보았습니다. RAG 부분 — 청크, 임베드, 검색, 컨텍스트 채우기, 생성 — 은 그들이 완벽하게 이해하고 있습니다. 그들이 놓치고 있는 것은 지루한 절반입니다. 노트북 셀에서 실행되는 체인을 어떻게 거버넌스되고, 버전 관리되며, 모니터링되는 REST 엔드포인트로 만들 수 있을까요? 이 엔드포인트는 채팅 UI에서 호출할 수 있고, 새벽 3시의 알림에도 살아남으며, 우주 전체를 재배포하지 않고도 다음 달에 A/B 테스트할 수 있어야 합니다. 이 글은 그 지루한 절반에 관한 것입니다. RAG를 개념적으로 이해하고 있다고 가정하고, 전체 Databricks 경로를 따라갈 것입니다. 체인을 작성하고, MLflow에 기록하고, Unity Catalog에 등록하고, Model Serving 엔드포인트에 배포하고, 모든 검색 및 생성을 추적하고, 라이브 상태가 된 후 해당 항목을 운영할 것입니다.