Amazon SageMaker HyperPod 现已支持... 笔记

Amazon SageMaker HyperPod 现已支持解耦的预填充与解码。

Amazon SageMaker HyperPod 现已提供用于 LLM 推理优化的解耦预填充与解码(Disaggregated Prefill and Decode, DPD)。DPD 将 LLM 推理的预填充(prefill)和解码(decode)阶段分离到不同的 GPU 池中。关键值缓存(key-value cache)数据通过 EFA 和 GPU-Direct RDMA 在这些池之间传输。此举解决了因共享 GPU 导致长上下文请求延迟其他请求的问题。通过将 GPU 专用于计算受限的预填充和内存带宽受限的解码,消除了资源争用。DPD 为严格的延迟要求提供了更一致的每 token 延迟和更高的吞吐量。它还允许根据工作负载分布独立扩展预填充和解码容量。智能路由器将长上下文请求引导至解耦路径,并将短提示直接路由至解码器。启用此功能需在现有的 InferenceEndpointConfig 资源中添加 pdSpec。该功能在所有支持的 AWS 区域中,针对使用 EFA 兼容实例的 EKS 上的 SageMaker HyperPod 集群可用。