클라우드 안정성 사고 처리 모범 사례
클라우드 장애는 사소한 영향부터 광범위한 영향까지 서비스에 상당한 혼란을 야기할 수 있습니다. 이러한 사고를 처리하기 위해 검증(Verify), 조사(Investigate), 보고(Report), 해결(Resolve), 검토(Review)의 구조화된 워크플로우가 권장됩니다. 실패를 염두에 둔 설계와 대응 단계 연습을 포함한 사전 준비는 매우 중요합니다. 이 가이드는 보안 관련 조치를 제외하고 안정성 사고 처리를 위한 기본적인 모범 사례에 중점을 둡니다. 사이트 신뢰성 엔지니어링(Site Reliability Engineering)에서는 AI 에이전트를 활용한 고급 기술도 등장하고 있습니다. 초기 단계는 자동화된 대응을 위한 설계, 즉시 사용 가능하고 복제된 데이터 보장, 명확한 역할이 정의된 플레이북 개발, 정기적인 훈련 연습 실시를 포함하는 준비입니다.다음 단계는 검증으로, 감지된 장애는 Google, 사용자 또는 제3자에게 귀속되어야 합니다. 개인화된 서비스 상태(Personalized Service Health)와 공개된 클라우드 서비스 상태 대시보드(Cloud Service Health dashboard)를 확인하면 Google이 사고를 선언했는지 여부를 판단하는 데 도움이 됩니다. 조사는 Google이 사고를 선언하지 않은 경우, 특히 최근 변경 사항을 고려하여 지표와 로그를 분석하여 원인을 파악하는 것을 포함합니다. 서비스 상태 대시보드가 정상임에도 불구하고 서비스가 실패하는 경우, 적절한 우선순위 설정과 상세한 사례 제출과 함께 Google에 보고해야 합니다.해결은 이해관계자와의 소통, 가능한 경우 보조 시스템으로의 장애 조치(failover), 임시 방편(workaround) 식별을 포함합니다. 기업은 또한 규제 보고 요구 사항도 고려해야 합니다. 안정성이 복구된 후에는 플레이북, 도구 및 교육 개선 영역을 식별하기 위해 비난 없는 사후 분석(blameless post-mortem)이 필수적입니다. 이 검토 프로세스는 향후 장애에 대한 사고 대응 역량을 개선하는 데 도움이 됩니다.