AWS Machine Learning Blog 中文 关注 使用 Curvine 在 Amazon SageMaker HyperPod 上为大型 LLM 实现分层 KV 缓存 在大规模运行大语言模型推理时,面临 KV 缓存的权衡:要么使用过大的 GPU 实例,要么牺牲首 token 生成速度。本文介绍在 Amazon SageMaker HyperPod 上构建分层 KV 缓存,通过 Curvine 将缓存扩展至共享的分布式 NVMe 池中,使得副本能够在成本效益更高的实例上以接近本地磁盘的速度复用缓存。 Tiered KV cache for large LLMs on Amazon SageMaker HyperPod with Curvine aws.amazon.com AWS Machine Learning Blog 中文 RSS thenote.app