Контейнеризация больших языков... Заметка
DZone.com Feed на русском

Контейнеризация больших языковых моделей: лучшие практики для ИИ-нагрузок на базе Docker

В первый раз, когда я упаковал дообученную модель Llama в контейнер для внутреннего поискового инструмента клиента, сборка заняла 38 гигабайт. Я помню, как смотрел на терминал, думая, что это не может быть правдой. Но это было правдой. Образ включал базовый образ CUDA, PyTorch со всеми скомпилированными бэкендами, веса модели, встроенные непосредственно в слой, и не очищенный кэш pip.Загрузка этого в наш реестр заняла одиннадцать минут при хорошем соединении. Скачивание на новый узел во время события автомасштабирования заняло еще больше времени, и к тому моменту, когда под был готов, всплеск трафика, который он должен был обработать, уже прошел. Именно в этот момент я перестал относиться к контейнерам LLM как к обычным контейнерам приложений, потому что это совершенно разные вещи.