DZone.com Feed на русском
Подписаться
Развертывание корпоративного чат-бота на базе LLM на Databricks с использованием RAG, MLflow, векторного поиска и обслуживания моделей
Демонстрация всегда работает. Кто-то подключает векторный индекс к базовой модели в блокноте, задает ей три вопроса по справочнику сотрудника, получает три четких ответа, и все в комнате кивают. Затем запрос становится "отправить это 4000 сотрудникам", и блокнот тихо умирает. Нет конечной точки, нет аутентификации, нет истории версий, нет способа понять, почему конкретный ответ был неправильным, и нет истории для случая, когда юристы спросят, как вы откатите промпт, который начал цитировать политику PTO 2019 года.Я видел, как несколько команд сталкивались с этой стеной. Часть RAG — разбиение, встраивание, извлечение, добавление контекста, генерация — они понимают в совершенстве. Чего им не хватает, так это скучной половины: как превратить цепочку, которая выполняется в ячейке блокнота, в управляемую, версионированную, мониторинговую конечную точку REST, которую может вызывать пользовательский интерфейс чата, которая выдержит вызов в 3 часа ночи, и которую вы сможете тестировать A/B в следующем месяце, не переразвертывая вселенную? Эта статья посвящена этой скучной половине. Мы предполагаем, что вы концептуально понимаете RAG, и пройдем весь путь Databricks: создадим цепочку, зарегистрируем ее в MLflow, зарегистрируем в Unity Catalog, развернем ее в конечной точке Model Serving, отследим каждое извлечение и генерацию, и будем эксплуатировать ее после запуска.