高可用性(High Availability, HA)系统的故障排查,核心目标是快速定位“为什么不可用 / 为什么切换失败 / 为什么脑裂”,并恢复服务。下面按思路 → 常见故障 → 排查步骤 → 工具 → 实战示例来说明。
先确认“是否真的不可用”
分清故障层级
看“状态”而不是“猜测”
可能原因:
表现:
常见原因:
可能原因:
可能原因:
以常见 HA 架构为例:
Pacemaker / Corosync
crm status
pcs status
corosync-cfgtool -s
Keepalived
systemctl status keepalived
ip addr | grep VIP
Kubernetes
kubectl get nodes
kubectl get pods -n <ns>
ping <peer-ip>
tcpdump -i eth0 port 5405 # corosync
重点看:
ip addr
df -h
ps -ef | grep <service>
/var/log/messages
/var/log/cluster/corosync.log
/var/log/pacemaker.log
journalctl -u keepalived
重点关键词:
timeoutfencinglost membershipresource stop failed排查:
原因:
解决:
如果你愿意,可以告诉我:
我可以直接帮你“对症下药”。
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。