人工智能

解析智能体竞争焦点从模型能力到上下文工程的范式转移

过去三年行业痴迷于更大模型与更高基准,如今智能体的胜负手已转向推理时可见信息的工程设计。本文梳理上下文工程的概念、技术与产业信号,说明为何它正成为智能体时代真正的护城河。

过去三年,AI 行业的记分牌简单粗暴:模型更大、基准更高、参数更多。如今这块记分牌正在误导人。自主智能体(Agent)的竞争前沿,已经悄悄从"模型能力"转移到工程师们口中的上下文工程(Context Engineering)——即在推理时,对模型所看到的一切信息进行刻意设计。

这个词在 2025 年 6 月进入主流,当时 Shopify CEO Tobi Lutke 与 Andrej Karpathy 几乎同时将其描述为智能体时代的关键技能。Karpathy 的类比最令人难忘:大模型是 CPU,上下文窗口是内存(RAM),而工程师就是操作系统。如果说模型是处理器,那么谁最擅长管理它的内存与输入输出,谁就赢——无论盒子里装的是哪颗芯片。

为何瓶颈是上下文,而非能力

一个朴素假设是:更强大的模型只需要更多 token。现实更残酷。大模型处理的每一个 token 都会消耗一份有限的注意力预算,而这份预算会随着长度递减。由于注意力是在所有 token 之间两两计算的(O(n²) 代价),且模型主要在较短序列上训练,性能会随上下文增长而下降——即便远未触及官方宣称的窗口上限。

这一点在 2025 年 7 月由 Chroma 的"上下文腐化(Context Rot)"研究量化:他们对 GPT、Claude、Gemini、Qwen 等 18 个前沿模型测试,发现即便仍在窗口之内,输出质量也会随输入变长而明显退化。这与两种更知名的失效模式不同:上下文窗口溢出(空间不够)和"中间迷失"(无法关注中部 token)。上下文腐化更隐蔽:同一个模型、同一个窗口,提示越长答案越差。

Drew Breunig 与 Elastic 随后归纳出上下文工程必须防范的四种运行失效:上下文投毒(Poisoning,被污染的 token 诱导行为)、干扰(Distraction,无关 token 挤占关键信号)、混淆(Confusion,相互重叠或矛盾的指令)与冲突(Clash,多智能体写入相互矛盾的状态)。这解释了为何一个强模型配上混乱上下文,可能输给一个弱模型配上干净上下文。

Anthropic 的操作手册

Anthropic 是这一话题最系统的发布者。其指南将上下文工程归纳为四个原语:写入(Write)——把状态持久化到外部,使其跨越窗口存活;选择(Select)——只从记忆中检索相关部分;压缩(Compress)——在不丢失信号的前提下削减 token;隔离(Isolate)——用子智能体让独立任务互不污染共享上下文。

对于跨越许多步骤、运行数分钟乃至数小时的长程任务,Anthropic 推荐三种技术:压缩重置(Compaction)——总结进展并重新初始化上下文以重置注意力预算;结构化笔记——用一个持续更新的外部文件(如 todo.md)把记忆移出窗口;子智能体架构——委派任务后只回填一段紧凑的 1,000–2,000 token 摘要,而非原始对话记录。

来自生产的经验:Manus 与 MCP

通用智能体 Manus 在 2025 年 7 月总结了六条来之不易的经验,其中经济意义最大的是围绕 KV 缓存设计:一个被缓存的 token 成本约为未缓存的十分之一,因此稳定前缀(系统提示、工具定义)就是 10 倍的降本杠杆。其他经验包括:用掩码而非删除工具(用 logit 掩码而非动态重写工具列表,后者会破坏缓存);把文件系统当作上下文(把中间状态写入磁盘);用复述(recitation)锚定注意力;保留错误样本让模型从失败中学习;以及避免被少样本带偏——控制提示多样性,防止模型塌缩到单一模式。

模型上下文协议(MCP)一度成为自身成功的牺牲品:开启过多服务端意味着把每个工具的 schema 都塞进上下文。2026 年的修复方式趋于一致:Anthropic 的工具搜索(Tool Search)(按需加载工具定义,约减少 85% token,2025 年 11 月上线)、代码执行/代码模式沙箱(Cloudflare 约 99.9%、Anthropic 约 98.7% 的削减,通过输出可执行代码替代内联工具 schema)、以及渐进式披露 / Agent Skills(先扫描约 100 token 的元数据,仅在需要时展开)。微软 Agent Framework 于 2026 年 7 月采用了渐进式 MCP 披露。

自适应上下文:ACE

研究前沿正让上下文本身具备适应性。斯坦福、SambaNova 与 UC 伯克利的 ACE(Agentic Context Engineering)(arXiv 2510.04618)用由 Generator/Reflector/Curator 循环维护、不断演化的"剧本(playbooks)"替代静态提示;增量式 delta 更新让上下文"生长并精炼"而非重置,从而同时规避简略偏差与上下文坍缩。报告收益:智能体基准 +10.6%、金融任务 +8.6%,成本较朴素重放降低 86.9%。

规模化的警示

更多智能体不等于更好。谷歌与 MIT 的《迈向智能体系统规模化的科学》(arXiv 2512.08296)覆盖 5 种架构、3 个模型家族、180 项配置,发现并行任务分解使成功率提升约 80.9%,而串行依赖会因错误沿链放大而下降 39%–70%(独立路由下放大 17.2 倍,集中控制下 4.4 倍)。单智能体每 1,000 token 完成 67 个任务,集中式多智能体仅 21 个。结论:上下文工程决定了规模化是助力还是反噬。

新职位头衔

这一转变带来人事后果。独立的"提示工程师"正让位于上下文工程师——设计记忆、检索、压缩与子智能体边界的人。失败数据令人警醒:企业报告约 65% 的智能体故障源于上下文漂移,88% 的生产智能体在上线后夭折,试点到生产的成功率从约 78% 跌至约 11%。问题从来不是模型,而是上下文。

结语

前谷歌 AI 负责人 Jeff Dean 认为模型能力正日益商品化;Satya Nadella 对基础模型也持类似看法。Gartner 预测到 2026 年底,40% 的企业应用将嵌入自主智能体。当模型可互换、智能体无处不在,持久的竞争护城河不再是权重,而是你喂给权重的工程。上下文工程,正是这道护城河。

#Context Engineering#Autonomous Agents
来源
  • Anthropic. (2025). Context Engineering for AI Agents. Anthropic Engineering Blog.
  • Chroma. (2025). Context Rot: How Increasing Input Tokens Degrades LLM Performance. Chroma Research.
  • Breunig, Drew. (2025). How Long Contexts Fail: Poisoning, Distraction, Confusion, Clash. Elastic Blog.
  • Manus. (2025). Engineering Lessons from Building a General-Purpose Agent. Manus Engineering.
  • Wang, S., et al. (2025). ACE: Agentic Context Engineering. arXiv:2510.04618.
  • Google & MIT. (2025). Towards a Science of Scaling Agent Systems. arXiv:2512.08296.
  • Anthropic. (2025). Tool Search for the Model Context Protocol. Anthropic.
  • Cloudflare. (2026). Code Mode Sandbox for Agents. Cloudflare Blog.
  • Microsoft. (2026). Progressive MCP Disclosure in the Agent Framework. Microsoft.
  • Karpathy, Andrej & Lutke, Tobi. (2025). On Context Engineering. Public Commentary.
  • Dean, Jeff. (2025). On Model Commoditization. Public Commentary.
  • Nadella, Satya. (2025). On Foundational Models as Commodity. Public Commentary.
  • Gartner. (2026). Forecast: 40% of Enterprise Applications to Embed Autonomous Agents by 2026. Gartner Research.