监控Monitoring
你可能会说
上线后盯住错误率和请求延迟,超过阈值就告警,并标出是哪个版本开始异常。
监控是持续采集和观察生产指标、日志与告警,以发现异常并判断系统健康。例如新版本发布后持续观察错误率、请求延迟和预订成功率,越过阈值时通知负责人并关联版本。一次测试报告只说明当时的检查结果,不能替代上线后的持续信号。
也常被叫作Monitoring生产监控应用监控
延伸阅读 · 权威出处
上线后盯住错误率和请求延迟,超过阈值就告警,并标出是哪个版本开始异常。
↳监控持续看线上信号;一次截图或用户口头反馈不能替代时间序列。
选择能反映用户健康的信号:登录错误率、下单成功率、请求延迟和关键日志,能让团队看见用户是否真的受影响。指标需要明确时间范围和阈值,不能只堆一张没人判断的仪表盘。
告警后要能连回运行事实:异常发生时,应能查看当时版本、相关请求和影响范围,再决定暂停发布、关闭功能开关、回滚或向前修复。监控是发现与判断,不是自动修复本身。
请为登录和下单配置生产监控:定义错误率/成功率阈值、告警方式,并让告警能关联当前版本和相关请求。上线后检查这些信号;超过阈值时给出关闭功能开关或回滚的明确动作。