服务器运维的事后分析(Post-Incident Analysis / Postmortem)核心目标不是“追责”,而是还原事实、定位根因、沉淀经验、防止再犯。下面给你一套可落地的方法论和模板。
建议:P1/P2 级事件必做,小问题可简版复盘
先记“发生了什么”,不要急着下结论:
精确到分钟:
10:02 告警:CPU 100%
10:05 值班介入
10:20 定位为慢SQL
10:35 杀掉异常连接恢复
10:50 业务正常
工具:监控(Prometheus/Zabbix)、日志(ELK)、工单系统
常用方法:
示例:
为什么宕机?→ 连接数打满
为什么打满?→ 慢查询
为什么慢?→ 缺索引
为什么缺?→ 上线未走SQL评审
必须:
# 故障复盘报告
## 1. 基本信息
- 事件名称:
- 等级:P1/P2/P3
- 时间:
- 负责人:
## 2. 事件概述
(一句话说明)
## 3. 时间线
| 时间 | 动作 | 人员 |
|----|----|----|
## 4. 根因分析
- 直接原因:
- 深层原因:
## 5. 影响范围
- 用户数:
- 损失:
## 6. 改进计划
| 项目 | 负责人 | 时间 |
|----|----|----|
## 7. 经验总结
如果你愿意,可以给我一个真实故障场景,我帮你写一份完整的事后分析报告样例。
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。