这套思路很实用,尤其是把 nr_throttled、throttled_usec 与 P99 延迟放到同一时间轴,比单看 docker stats 更容易形成证据链。补充一点:采集时最好保留原始计数并计算相邻时间点的增量,否则容器运行时间不同,累计值不太方便横向比较。
另外,排查 cpuset 时建议同时查看每核软中断和宿主机 steal ti...
补充一个容易忽略的点:修改 daemon.json 后,不仅要校验配置和重启 Docker,还要确认业务容器确实已经重新创建,否则旧容器仍会沿用原来的日志策略。实际排查时可以先记录大日志对应的容器、增长速度和错误类型,再处理文件,避免清理后丢失根因线索。
另外,Compose 项目最好在模板里统一声明 logging 配置,并把磁盘剩余空间和日志增长率同时纳入告警。单看磁盘使用...