这张卡讲智能体排障的命脉:那条能回答「错在哪一步」的完整链路。

核心拆解:调用链追踪把一次请求经过的每个环节——检索、模型调用、工具执行、护栏检查——记录成带时间与父子关系的结构。智能体系统的差异在环节是模型动态决定的,追踪还要存每步的上下文快照,否则回放时无法解释当时为什么这么决策。最常见的欠账是追踪没有贯穿 ID:评测发现某条失败用例,线上却对不上是哪次请求,两条体系成了孤岛。

增量判断:国内私有化环境通常自建追踪设施,方案里要写清兼容性与存储成本。FDE 的现场用法是把追踪 ID 写进客户报障流程——客户报障带 ID,定位从小时级降到分钟级。

行动建议:检查你系统的追踪是否覆盖每步工具调用的参数与返回状态,没有就补。追踪采样策略也要写进文档,全量还是抽样、理由是什么,都要一条条写明白。遗漏一项就可能卡住一次排障。

—— FDEChina编辑部 · 架构师视角

定义

调用链追踪(Trace)指把一次请求在系统中经过的全部环节——检索、模型调用、工具执行、护栏检查——按时间与父子关系记录成链,供排障、性能分析与决策回放使用。

展开

智能体系统的追踪与传统服务不同:调用序列由模型动态决定,同一类请求的链路形状都不一样,因此除了记录环节本身,还要存每一步的上下文快照——当时的输入是什么、模型看到了什么、为什么选了这个工具,否则事后回放无法解释决策。工程关键是一条贯穿全链的追踪 ID,并让它延伸到评测与客户报障流程:评测发现的失败用例能关联到线上具体请求,客户报障带 ID 能把定位从小时级压到分钟级。与遥测、可观测性的层次关系:遥测是采集机制,追踪是其中以请求为轴的结构化采集,可观测性是包含两者的整体能力。私有化交付时,追踪数据存储成本随流量增长,采样策略与留存期限要写进运维协议,追踪缺失在事故后无法补录。

参见

智能体上线检查清单FDE 交付指标FDE 实战指南