Recent Announcements 中文 关注 Amazon SageMaker HyperPod 现已支持解耦的预填充与解码。 Amazon SageMaker HyperPod 现已提供用于 LLM 推理优化的解耦预填充与解码(Disaggregated Prefill and Decode, DPD)。DPD 将 LLM 推理的预填充(prefill)和解码(decode)阶段分离到不同的 GPU 池中。关键值缓存(key-value cache)数据通过 EFA 和 GPU-Direct RDMA 在这些池之间传输。此举解决了因共享 GPU 导致长上下文请求延迟其他请求的问题。通过将 GPU 专用于计算受限的预填充和内存带宽受限的解码,消除了资源争用。DPD 为严格的延迟要求提供了更一致的每 token 延迟和更高的吞吐量。它还允许根据工作负载分布独立扩展预填充和解码容量。智能路由器将长上下文请求引导至解耦路径,并将短提示直接路由至解码器。启用此功能需在现有的 InferenceEndpointConfig 资源中添加 pdSpec。该功能在所有支持的 AWS 区域中,针对使用 EFA 兼容实例的 EKS 上的 SageMaker HyperPod 集群可用。 Amazon SageMaker HyperPod now supports disaggregated prefill and decode aws.amazon.com Recent Announcements 中文 RSS thenote.app
InferenceEndpointConfig资源中添加pdSpec。该功能在所有支持的 AWS 区域中,针对使用 EFA 兼容实例的 EKS 上的 SageMaker HyperPod 集群可用。