这套从容器内部逐层向外排查的思路很实用,比上来就重启 Docker 或清空规则稳妥得多。补充一点:定位 veth 时可以结合容器 PID、接口索引和 ethtool -S 查看 peer 信息,避免被随机接口名干扰。抓包时建议同时观察 ARP、ICMP 和 DNS 流量,并记录各节点是否能看到请求及回包。如果重启后才出现异常,还应重点检查 firewalld...
这类问题确实容易被忽略,尤其是业务本身运行正常时,大家往往只关注 CPU 和内存。排查时除了看 Z 状态,我觉得还应结合 PPID 和数量变化判断,避免把短暂退出过程误认为故障。实际部署中,单进程容器用 exec 启动主程序,再配合 init: true,通常能解决大部分信号转发和回收问题。不过,--init 更适合作为兜底...