スパイク前のスケーリング:KubernetesにおけるGPU... ノート

スパイク前のスケーリング:KubernetesにおけるGPUワークロードのための予測的オートスケーリング

火曜日の朝、私たちはページングを受けました。トラフィックの下でクリティカルな本番サービスがクラッシュしました。徐々に劣化するのではなく、クラッシュしたのです。保留中のポッドは数百個。ユーザーは15〜20%のエラー率を見ていました。インシデントのポストモーテムは…
CdXz5zHNQW_YD5u2CA0rr.jpeg