Помимо проверок времени безраб... Заметка
DEV Community на русском

Помимо проверок времени безработности: значимый мониторинг инфраструктуры

Ваша панель мониторинга может показывать, что все системы в норме, но сообщения пользователей могут выявить неисправную функциональность. Традиционный мониторинг часто проверяет только запуск процессов, что является лишь биением сердца, а не истинным мониторингом. Настоящий мониторинг должен проверять работоспособность критически важных пользовательских сценариев, допустимые уровни ошибок и соответствие задержек установленным пределам. Он также должен проверять завершение фоновых заданий и согласованность данных между службами. Это выходит за рамки простого мониторинга серверов и обеспечивает работу всей системы.Надежная стратегия мониторинга включает три уровня: состояние системы для базовых метрик, таких как ЦП и память; состояние службы для кодов ответа конечных точек и задержек; и состояние бизнеса для критически важных пользовательских сценариев. Многие команды останавливаются на уровне состояния системы, в то время как наиболее эффективные команды автоматизируют мониторинг состояния бизнеса. "Достаточно хороший" мониторинг определяет критически важные пользовательские сценарии, инструментирует их частыми синтетическими проверками и устанавливает значимые пороговые значения. Крайне важно оповещать о симптомах, таких как сбои при оформлении заказа, а не только о причинах, таких как высокая загрузка ЦП.Автоматизация исправления проблем, выявленных мониторингом, также является ключевым моментом. Резюме подчеркивает, что если ваш мониторинг не может отличить работающий сервер от пользователей, выполняющих задачи, это не истинный мониторинг. Это лишь биение сердца, которое указывает только на полную неработоспособность системы, а не на ее болезнь или плохую производительность.