温馨提示×

温馨提示×

您好,登录后才能下订单哦!

密码登录×
登录注册×
其他方式登录
点击 登录注册 即表示同意《亿速云用户服务条款》

Node节点宕机怎么排查

发布时间:2026-09-06 01:41:50 来源:亿速云 阅读:86 作者:小樊 栏目:系统运维

“Node 节点宕机”在不同场景下含义不同(Kubernetes Node、区块链节点、一般服务器节点等)。下面以最常见、最复杂的 Kubernetes Node 宕机为主线说明排查思路,同时补充通用服务器/节点宕机的排查方法。


一、Kubernetes Node 节点宕机排查

1. 确认节点状态

kubectl get node
kubectl describe node <node-name>

关注:

  • Status: Ready / NotReady
  • Conditions: MemoryPressure / DiskPressure / PIDPressure
  • LastHeartbeatTime 是否停止

2. 判断是“真宕机”还是“假宕机”

  • Node 完全无响应(SSH 不通)→ 物理/虚拟机宕机
  • Node 状态 NotReady 但能 SSH → kubelet / 网络问题

3. 查看 kubelet 状态(在节点上)

systemctl status kubelet
journalctl -u kubelet -f

常见问题:

  • kubelet 崩溃
  • 证书过期
  • 资源耗尽(OOM)

4. 检查系统资源

top
free -h
df -h
uptime
dmesg | tail

重点看:

  • 内存耗尽(OOM Killer)
  • 磁盘满(特别是 /var/lib/kubelet)
  • inode 满

5. 查看系统日志(关键)

/var/log/messages
/var/log/syslog
/var/log/kern.log
journalctl -k

典型宕机原因:

  • kernel panic
  • 硬件错误
  • 断电
  • OOM

6. 网络排查

ping <node-ip>
ss -antp | grep 6443
  • 控制面不通 → Node 被标记为 NotReady
  • 网络插件(Calico/Flannel)异常

7. 容器运行时

systemctl status docker / containerd
crictl ps
  • 容器运行时挂掉 → 节点不可用

8. 恢复步骤

  • 能恢复:重启 kubelet / 清理磁盘 / 重启节点
  • 不能恢复:
kubectl drain <node> --ignore-daemonsets
kubectl delete node <node>

再重新加节点


二、通用服务器 / 节点宕机排查

1. 是否能登录

  • 不能登录 → 看控制台 / BMC / 云厂商控制台
  • 能登录 → 查日志

2. 查看宕机原因

last -x
journalctl -b -1
dmesg -T

3. 常见原因

  • 电源 / 硬件故障
  • 内核崩溃
  • OOM
  • 磁盘损坏
  • 被误操作 reboot

三、区块链 / 分布式 Node 宕机(简略)

  • 查看节点日志
  • 检查:
    • 网络连通性
    • 磁盘空间
    • 同步高度是否落后
    • 配置错误

四、总结排查顺序(通用)

  1. 确认是否真宕机
  2. 看节点状态 / 日志
  3. 查资源(CPU / 内存 / 磁盘)
  4. 查网络
  5. 查关键进程
  6. 必要时重启 / 替换节点

如果你能补充说明:

  • K8s / 云服务器 / 区块链 / 其他
  • 物理机 / 虚拟机 / 容器
  • 宕机表现(SSH 不通?状态异常?)

我可以给你更精准的排查清单

向AI问一下细节

免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。

AI