这份排查思路很实用,尤其赞同先看 Health.Log、再手动执行探针命令,而不是上来就重启。补充一个容易忽略的点:如果健康检查使用 CMD-SHELL,管道中前面的命令失败可能被后续命令掩盖,最好明确处理退出码;同时可给检查接口设置独立、简短的日志,方便按时间关联应用异常。
线上还可以持续观察一段时间,区分“始终失败”和“负载升高时偶发失败”。前者多半是命令、端口或路径配置问题...
这套排查思路很实用,尤其是先看 locale -a,能避免只设置环境变量却没有生成对应 Locale 的坑。我之前还遇到过镜像里配置正常,但被 Compose 的 environment 覆盖,最后通过检查容器实际环境才定位到。建议 CI 除了输出中文,也加入中文文件名的创建、读取和日志采集测试。若业务只要求 UTF-8,优先使用镜像已有的 C.UTF-8,...
这套排查顺序很实用,尤其是先看 docker inspect,再核对 memory.max、cpu.max 和 pids.max,能快速区分“参数没传进去”还是“内核没有执行”。补充一点:做压力测试时最好记录测试前后的 memory.events 和 cpu.stat 7天前 0