Amazon SageMaker HyperPod 现已支持对具有持续供应功能的 Slurm 集群执行深度健康检查。
Amazon SageMaker HyperPod 现已支持针对通过持续供应创建的 Slurm 编排集群执行深度健康检查,使您能够随时主动验证运行中实例的 GPU 加速器健康状况。持续供应功能可让您快速启动训练,并异步扩展实例组,而不会出现全有或全无的故障;如今,您可以将这种灵活性与其全面的硬件验证相结合,在实例上线时进行验证。此功能解决了一个关键挑战:即使单个节点不健康,也可能浪费数小时的计算时间并延误关键工作负载。借助深度健康检查,您可以在将计算资源提交给作业之前,针对整个实例组或特定实例运行全面的硬件压力测试和连接性测试。由于持续供应会在容量可用时异步向 Slurm 集群添加工作节点,因此您可以在每个新节点上线时对其执行深度健康检查,在调度作业前验证其硬件,且不会中断已在健康节点上运行的工作负载。进度和结果可通过 SageMaker 控制台和 API 在实例组和实例级别进行查看,从而提供对 GPU 健康状况、网络连接性以及多节点通信性能的完整可见性。正在接受检查的实例会自动从工作负载调度中隔离,并在通过检查后恢复服务。当与 HyperPod 的自动节点恢复功能配合使用时,失败的实例会自动重启或替换,从而确保集群健康。此功能在所有提供 Amazon SageMaker HyperPod 的区域均可用。如需了解按需深度健康检查和持续供应的更多信息,请参阅 Amazon SageMaker HyperPod 用户指南。