这张卡帮你把上下文窗口从参数表里的一行数字变成预算管理的对象。

核心拆解:上下文窗口是模型单次推理能看见的全部内容上限,系统提示词、对话历史、检索结果、工具返回、输出全挤在这一个预算里。最普遍的误区是窗口变大就不用管了:其一,长上下文存在中间迷失,放在中段的关键信息召回率明显下降;其二,成本按 token 计费,窗口用得越满单次调用越贵;其三,很多噪音会稀释注意力,输出质量不升反降。

增量判断:国内私有化场景常用开源模型,有效上下文普遍短于宣传值,且超长输入的延迟问题在客户硬件上被放大。FDE 的增量视角是容量核算习惯——交付前就估算典型任务的窗口占用,写进方案约束。

行动建议:核算你当前最重链路的窗口占用分布,标出哪一部分占了预算却贡献最低。占预算多而贡献低的部分,优先做摘要或裁剪。

—— FDEChina编辑部 · 实战派

定义

上下文窗口(Context Window)指模型单次推理能处理的内容上限,以 token 计量:系统提示词、对话历史、检索结果、工具返回与本次输出全部共享这同一份预算。

展开

窗口大小是硬约束,超限即截断或报错,而截断通常悄悄发生在最旧的历史或最长的文档上——客户看到的就是「聊着聊着它忘了」。常见误区是窗口越大越不用管:长上下文存在中间迷失现象,埋在中段的关键信息召回明显变差;塞满窗口还会放大成本与延迟,噪音稀释注意力后输出质量反而下降。正确姿势是把窗口当预算管理:什么进、什么被摘要、什么丢弃,属于上下文工程的决策范围。与 token 成本的辨析:窗口是单次调用的容量上限,token 成本是每次占用与产出的计费结果,容量管的是能不能装下,成本管的是装下去划不划算。FDE 现场应养成容量核算习惯,交付前估算典型任务的窗口占用分布,写进方案约束与报价依据。

参见

智能体专题AI 编程专题FDE 实战指南