使用 Curvine 在 Amazon SageMaker ... 笔记

使用 Curvine 在 Amazon SageMaker HyperPod 上为大型 LLM 实现分层 KV 缓存

在大规模运行大语言模型推理时,面临 KV 缓存的权衡:要么使用过大的 GPU 实例,要么牺牲首 token 生成速度。本文介绍在 Amazon SageMaker HyperPod 上构建分层 KV 缓存,通过 Curvine 将缓存扩展至共享的分布式 NVMe 池中,使得副本能够在成本效益更高的实例上以接近本地磁盘的速度复用缓存。
CdXz5zHNQW_kgyKTy3mMc.png