项目中全链路跟踪实践与落地
一句话概括:APM 不是”上个监控系统”,而是回答四个递进的问题——系统健康吗(Metrics)、慢在哪一跳(Traces)、当时到底发生了什么(Logs)、哪里是系统性瓶颈(三者聚合)。这四层缺一层,排查就会退化成人肉翻日志。而把它们串起来的那根线,只有一个东西:一个全局唯一的 traceId。
一、先还原一次真实的排查现场
线上告警来了,某个接口开始报错。你会怎么查?
我把我们团队过去的真实动作拆出来,是这样一条路径:
1 | 告警响了 |
举个具体例子。一次报错的完整链路是:
1 | api-gateway → query-service → queryByThirdParty → error |
三跳。为了知道 error 出在第三跳,你要把上面那套动作做三遍。
这套流程的平均耗时:15~30 分钟。





