应用健康端点设计:三个保持日志和指标有效的探针 笔记

应用健康端点设计:三个保持日志和指标有效的探针

Kubernetes 探针应各司其职:启动探针检查初始化是否完成,就绪探针评估实例能否处理流量,存活探针判断进程是否卡死。 启动探针为初始化任务(如编译定价规则)提供额外时间,确保在其他探针激活前完成必要准备。 就绪探针验证实例能否服务当前生效的规则及必要的依赖状态,若失败则将 Pod 从服务端点中移除。 存活探针检测不可恢复的进程问题,一旦发现问题即触发容器重启。 这种分离机制可防止无关的依赖故障引发不必要的容器重启,从而避免问题放大。 对于物业管理 API,就绪探针确保实例已准备好服务特定定价规则,保护租户免受报价不一致的影响。 当初始化耗时超过存活探针预算时,启动探针至关重要,可防止过早执行存活或就绪检查。 就绪探针适用于那些能阻止新流量但无需重启即可恢复的条件,例如缺少规则快照。 存活探针仅用于可通过重启修复的问题,例如无响应的事件循环,且范围应尽可能窄,以避免不必要的重启。 健康端点应为每种探针类型使用不同的路径,存活检查中应避免网络调用,并返回最小化的状态码。