Talk Python to Me: #559: AWSでや... ノート

Talk Python to Me: #559: AWSでやるべきこと・やるべきでないこと12選

コストのかかる時間単位の障害管理の専門家であるマット・リーは、緊急事態に対処するための重要な決定は、それらが発生するずっと前に下されると強調しています。彼は、将来の問題を防ぐために、通常の勤務日に行われる予防措置を提唱しています。この議論では、インフラストラクチャ・アズ・コードやIAMロールの使用など、彼のトップ12のAWSベストプラクティスについて説明します。また、小規模なVPSインスタンスを管理する個人にとってこれらのプラクティスが適用可能であるかどうかも論じます。その後、会話は、意図的な障害がシミュレートされるプラットフォームであるCloud War Gamesに移ります。これにより、チームは実際の状況に影響を与えることなく、実践的なインシデント対応の経験を積むことができます。これらのシミュレーションは、管理された環境内での最初の実際のインシデントとなるように設計されています。最終的な目標は、チームが予期せぬシステム障害に必要な準備を整えることです。この準備は、障害の影響と評判へのダメージを最小限に抑えるのに役立ちます。