这张卡讲一个正在被越来越多人重视的工程层:脚手架决定模型的实际成绩。

核心拆解:智能体脚手架是围绕模型的循环机制、工具接口、上下文组织与状态管理设施,模型的原始能力要经它放大或削弱后才变成系统能力。行业共识性的观察是:同一模型在不同脚手架上的任务成绩可以差出一大截。设计要点在反馈质量——错误信息写得清,模型自我修正就快;上下文组织得好,长任务就稳。最常见的误用是把脚手架当静态胶水代码,从不为它建评测。

增量判断:与编排层的辨析:编排管多任务调度与流程,脚手架管单个智能体的运行循环与模型交互质量。FDE 的增量视角是把脚手架当成正式评测对象:换脚手架等同换模型,必须全套回归。

行动建议:审视你智能体的循环设计,错误反馈是否具体、上下文是否逐轮膨胀失控。脚手架版本也要登记进运维文档。

—— FDEChina编辑部 · 实战派

定义

智能体脚手架(Agent Harness)指围绕模型搭建的运行设施——主循环、工具接口、上下文组织、状态与错误管理——模型的原始能力经过它放大或削弱后,才成为系统的实际能力。

展开

行业公开的评测实践反复验证一个观察:同一模型换不同脚手架,任务完成率可以差出一大截,因此评测结论必须绑定「模型加脚手架」的整体,单看模型分数会误判交付能力。脚手架质量的关键在反馈设计:工具报错信息具体可执行,模型就能自我修正;错误笼统含糊,同样的失败会循环重放。上下文管理也是脚手架职责——长任务里历史逐轮膨胀、关键状态被挤掉,是智能体中段崩坏的常见根源。与编排层的辨析:编排管多个任务与智能体之间的调度、顺序与失败处理,脚手架管单个智能体的运行循环与模型交互质量,两者常被框架一并提供但职责不同。与提示词工程的分工:提示词决定模型看到什么指令,脚手架决定模型处于什么运行环境。FDE 应把脚手架纳入评测基线:任何脚手架改动等同模型改动,必须走全套回归。

参见

智能体专题评测回归模式FDE 实战指南