AWS DevOps Blog 中文 关注 使用 AWS DevOps Agent 自动化 SageMaker HyperPod 事件排查与根本原因分析 引言:大规模机器学习工作负载(包括训练、微调及推理)需在数百至数千个 GPU 实例组成的集群上连续运行数天甚至数周。如此规模的集群运维可见性始终是一项持续挑战:硬件健康事件、节点生命周期转换、容量波动以及工作负载级问题会频繁出现在事件流中…… Automate SageMaker HyperPod incident triage and root-cause-analysis with AWS DevOps Agent aws.amazon.com AWS DevOps Blog 中文 RSS thenote.app