这套排查顺序很实用,尤其是强调退出码 137 不能直接等同于 OOM。之前遇到过类似情况,容器显示被杀,但最终还得结合 OOMKilled 和宿主机内核日志才能确定范围。
建议排查时顺手记录故障前后的 memory.current、memory.events 和业务并发量,单看 docker stats 很容易错过瞬时尖峰。Java 服务还要特别注意:堆上限别贴着容器硬限制设...
这套排查顺序很实用,尤其是先用 IP 连通性和域名解析结果区分网络故障与 DNS 故障,能避免一上来就盲目更换解析器。补充一点:遇到偶发超时时,可以连续执行多次查询,并对比 UDP、TCP 查询结果,排除防火墙或 VPN 对 53 端口的影响。
实际维护中,建议把最终配置写进 Compose 或 daemon.json,并在变更前备份原文件。配置完成后不只测试公网域名,还应检查...