Amazon SageMaker HyperPod 现已支持模型缓存,以实现更快的推理自动扩展并减少冷启动时间。
Amazon SageMaker HyperPod 现已支持模型缓存,这是一种推理优化技术,可将模型权重和容器镜像预加载至集群节点,使 Pod 的启动时间从分钟级缩短至秒级。在大规模运行 LLM 推理时,诸如聊天助手、智能体管道、RAG 和文档分析等工作负载会面临冷启动这一真实瓶颈。部署和扩缩容事件的大部分时间都用于下载容器镜像和模型权重。随着模型规模增大,这一问题愈发严重,大型模型在能够处理流量之前可能需要数十分钟。模型缓存通过两项独立功能解决此问题:权重缓存将模型权重存储于本地 NVMe 上,使 Pod 从高速本地存储读取,而非通过网络从 S3 或 FSx 拉取;镜像缓存则预先拉取容器镜像,使 Pod 完全跳过 ECR 下载。若 Pod 落在未配备预热缓存的节点上,系统会自动回退至原始源进行拉取,从而避免 Pod 卡住或失败的风险。针对 57 GB 至 145 GB 不同规模模型的基准测试显示,扩缩容速度提升约 60%,而镜像缓存可将镜像拉取时间减少超过两分钟(降幅达 97%)。随着模型规模增大,其收益也随之提升,同时保留了原始源路径的可靠性。客户可通过在 InferenceEndpointConfig 或 JumpStartModel 资源中添加 modelCacheConfig 部分来启用模型缓存,该功能由 HyperPod 推理算子(HyperPod Inference Operator)管理,涵盖完整生命周期,无需手动配置或清理。模型缓存现已在所有支持 SageMaker HyperPod 的区域普遍可用。如需开始使用,请参阅 SageMaker HyperPod 文档。