容器化大语言模型:基于 Docker 的 AI 工作负载最佳... 笔记

容器化大语言模型:基于 Docker 的 AI 工作负载最佳实践

第一次为客户的内部搜索工具容器化一个微调后的 Llama 模型时,构建完成后的镜像大小达到了 38 GB。我记得盯着终端屏幕,心想这肯定不对。但事实确实如此:该镜像包含了 CUDA 基础镜像、编译了所有后端的 PyTorch、将模型权重直接烘焙到层中,以及一个未清理的 pip 缓存。将该镜像推送到我们的注册表,在连接良好的情况下耗时 11 分钟。而在自动扩缩容事件中将其拉取到全新节点时,耗时更长;等到 Pod 就绪时,它本应处理的流量峰值早已过去。那一刻,我停止将 LLM 容器当作普通应用容器来处理,因为它们根本不是同一类事物。