1. 上下文管理的核心挑战与行业现状
大型语言模型(LLM)的上下文管理已经成为AI Agent开发中最关键的技术瓶颈之一。所有主流AI公司都面临同一个基本矛盾:模型的上下文窗口有限,而Agent生成的token数量却呈指数级增长。以一个典型任务为例,平均需要进行50次工具调用,每次调用都会向上下文添加观察结果。如果不进行干预,上下文窗口很快就会填满,导致模型性能急剧下降——这种现象被业界称为"上下文腐烂"(context rot)。
不同公司对这个问题的描述各有特色:Anthropic称之为"注意力预算"问题,LangChain则用"上下文窗口=RAM"的类比来解释。但所有从业者都达成了一个共识:更聪明的上下文管理策略,比单纯扩大上下文窗口更为重要。这个共识背后有着深刻的工程考量——即使是最先进的模型,在处理超长上下文时也会出现15-47%的性能下降。
当前行业的技术路线主要分为两大阵营:以Google为代表的"长上下文派",主张通过扩大窗口容量来解决问题;以及以Manus、Cursor等为代表的"智能管理派",专注于开发更高效的上下文组织策略。有趣的是,这些公司都通过博客、SDK文档和研究论文公开了自己的方案,为我们提供了难得的横向比较机会。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. Manus的六条生产原则解析
2.1 工程背景与演进历程
Manus作为服务数百万用户的AI平台,其技术方案建立在丰富的实战经验基础上。他们的典型任务场景具有两个显著特征:平均50次的工具调用频率,以及输入与输出token比例高达100:1的极端不平衡。这种业务特性使得上下文管理成为影响系统性能和成本的关键因素。
Manus团队透露,他们已经重写了四遍Agent框架,每次重写的核心驱动力都是发现了更好的上下文塑形方式。他们幽默地将这个过程称为"随机梯度下降"——通过持续迭代逐步逼近最优解。这种工程哲学反映了AI系统开发的一个本质特征:在快速演进的技术 landscape中,没有一劳永逸的解决方案。
2.2 六条核心原则详解
KV-Cache优化原则:Manus发现缓存的token成本仅为未缓存的十分之一(3/MTok vs 30/MTok)。因此他们制定了严格的缓存策略:保持prompt前缀稳定,日志只允许追加模式。甚至JSON键名的重新排列这种看似无害的操作也会导致缓存失效,被严格禁止。
Logit屏蔽技术:与传统做法不同,Manus不动态加载卸载工具,而是保持所有工具永久加载。通过约束解码时的输出token概率来控制工具可用性。这种方法虽然增加了初始加载成本,但显著提高了上下文稳定性。
文件系统扩展记忆:对于大型观察结果,Manus采用"写入文件+轻量引用"的策略。只要保证操作可逆,任何形式的压缩都被允许。这种设计类似于操作系统的虚拟内存机制,将不常用的数据交换到"磁盘"(文件系统)中。
注意力引导技术:通过维护一个动态更新的待办事项列表,并强制模型在每一步重新阅读,Manus成功将当前目标保持在模型的高注意力区域(通常是上下文末尾)。这相当于为模型提供了一个持续的注意力锚点。
错误保留策略:与传统系统不同,Manus故意保留失败的操作记录。这些"负面教材"有助于模型进行隐式信念更新,显著降低了重复犯错率。这种设计体现了"失败是成功之母"的工程哲学。
结构化变化机制:为了防止模型陷入僵化的行为模式,Manus在不同迭代中使用不同的序列化模板和措辞。这种刻意引入的变化类似于生物进化中的变异机制,保持了系统的创新能力。
3. Cursor的动态上下文发现方案
3.1 技术背景与核心洞见
Cursor在2026年1月的研究博客中披露了他们的关键技术发现:随着模型能力的提升,减少预设细节、让Agent自主获取上下文反而能获得更好的效果。这个结论基于严格的A/B测试数据,反映了AI系统开发中一个有趣的范式转变——从"全知全能的上帝视角"到"按需获取的自主探索"。
3.2 五种关键技术实现
文件接口标准化:Cursor将大型JSON响应直接写入文件,Agent通过tail/grep等命令增量读取。这种设计避免了不必要的数据摘要,保持了信息的完整性。在实践中,这种方案比传统的摘要方法减少了约30%的冗余操作。
无损压缩历史:Cursor创新性地将完整聊天历史先保存到文件,再进行摘要。这种"先备份后处理"的策略使得系统可以在必要时恢复任何丢失的细节,将有损压缩转化为事实上的无损压缩。
可发现式技能库:不同于传统预加载方式,Cursor将领域能力存储为文件,让Agent通过搜索发现所需技能。这种方法显著降低了初始上下文的负担,实测中减少了约25%的启动延迟。
懒加载MCP工具:Cursor只预加载工具名称,按需获取完整定义。这种按需加载策略在A/B测试中减少了46.9%的token使用量,是本文记录的最显著优化案例之一。
终端会话文件化:Cursor将Shell历史转化为可搜索的文件,Agent通过grep获取所需内容。这种设计巧妙地将人类工程师的工作习惯移植到AI系统中,大幅提升了工具的易用性。
Cursor方案的核心假设是:现代模型已经足够智能,能够自主判断需要哪些上下文。这个假设正在被越来越多的实践所证实,代表了上下文管理的一个重要发展方向。
4. Anthropic的注意力预算框架
4.1 理论基础与研究历程
Anthropic在2025年9月发布的框架被广泛认为是上下文工程的奠基性工作。他们随后在2026年1月深入探讨了长时间运行Agent的实现,并在2025年11月研究了基于MCP的代码执行方案。这些研究构成了一个完整的理论体系,为行业提供了系统性的方法论。
4.2 核心策略与技术实现
System Prompt的黄金分割:Anthropic发现了两种失败模式:过度工程的system prompt(超过2000词的复杂逻辑)和过于模糊的提示(如简单的"be helpful")。他们的解决方案是采用结构化标记(XML或Markdown标题)组织内容,配合典型示例展示预期行为,在确定性与灵活性间取得平衡。
运行时检索机制:Anthropic正在将检索时机从推理前调整为循环内,实现了真正的动态上下文加载。这种转变类似于数据库系统从静态预加载到动态查询的演进。
工具设计原则:Anthropic强调工具应该自包含且明确。他们提出了一个简单的测试标准:如果人类工程师无法明确判断在给定情境下该使用哪个工具,那么模型也不可能做得更好。
智能压缩阈值:Claude Code在窗口达到95%容量时自动触发摘要机制。对于长时间运行的任务,还会创建跨窗口持久化的需求文件(通常包含200+特性描述)。这种设计确保了关键信息不会在上下文切换中丢失。
代码优先的执行策略:对于复杂操作,Anthropic鼓励Agent编写代码来调用工具,而非直接调用。这种方法虽然增加了初始开发成本,但显著提升了复杂任务的可靠性和可维护性。
5. OpenAI的会话记忆架构
5.1 设计哲学与实现路径
OpenAI的方案体现在他们的Agents SDK和两份详细的cookbook中。与其它公司不同,OpenAI更注重提供开发者友好的基础设施,而非特定的算法创新。这种定位使得他们的方案更容易被广泛采用。
5.2 三种记忆模式对比
截断模式:最简单的策略,删除早期轮次,保留最近的N个交互。优点是实现简单、确定性高、零延迟;缺点是会导致早期约束的"失忆"现象。OpenAI的测试显示,这种模式适合短会话场景,平均可节省40%的上下文空间。
压缩模式:使用单独的模型调用摘要早期历史。摘要过程可以修正之前的错误,但存在"摘要漂移"的风险。OpenAI建议配合校验机制使用,可以将长会话的上下文占用减少60-70%。
基于状态的长期记忆:OpenAI最具特色的方案,使用结构化状态对象(profile + notes)跨会话持久化。每次运行时执行三步操作:提炼记忆→合并notes→注入状态(按优先级:最新输入→会话→全局默认)。这种设计支持信念更新而非简单的事实积累,更适合个性化场景。
OpenAI特别区分了基于检索的记忆和基于状态的记忆。前者适合事实积累,后者更适合维护持续的用户画像和行为模式。这种分类为开发者提供了清晰的选择框架。
6. Google的长上下文技术路线
6.1 技术背景与战略选择
Google采取了与行业主流截然不同的技术路线。当其他公司专注于优化有限窗口下的信息组织时,Google押注于上下文窗口的持续扩展——Gemini模型支持高达2M token的上下文,研究测试甚至扩展到10M。这种"富足思维"体现了Google独特的技术战略。
6.2 关键技术方案
全量上下文策略:Google默认尽可能填满上下文窗口,认为RAG和摘要是有限上下文模型的妥协方案。令人惊讶的是,Gemini仅从上下文材料就学会了翻译使用者不足200人的Kalamang语言,展示了超长上下文的强大潜力。
上下文缓存优化:通过创新的缓存API,Google实现了高达75%的成本节约。这种优化与Manus的KV-cache策略异曲同工,但规模更大。
渐进式截断:对于极端长上下文,Google采用渐进式压缩策略,在保持逻辑线程的同时逐步精简早期内容。这种平衡策略在测试中表现出色。
ReadAgent研究:Google的创新性"gist记忆"系统将交互压缩为情景要点,需要时查找原文。实验室数据显示,这种方法可以扩展20倍有效上下文,模拟了人类阅读长文档的方式。
多样本上下文学习:Google充分利用巨大窗口的优势,在上下文中放置数百甚至数千个样本,达到了接近微调模型的性能。这种方法特别适合few-shot学习场景。
Google的研究揭示了一个有趣的现象:长上下文并没有消除对上下文工程的需求,而是改变了它的形态。即使在10M token的窗口下,智能管理仍然能带来15%以上的性能提升。
7. LangChain的框架分类法
7.1 方法论贡献
LangChain的独特价值在于分类学贡献。他们不提出新的算法,而是将业界的各种实践组织成连贯的框架。这种工作对于统一行业术语、促进技术交流具有重要意义。
7.2 四种基本操作
写操作:将上下文保存在窗口外,包括草稿本、持久化状态对象和文件系统存储。例如,Anthropic的多Agent研究员将计划存入记忆库,以应对200K token的上下文限制。
拉操作:通过RAG、语义搜索或文件系统遍历(grep/glob)获取相关上下文。LangChain强调,关键在于在正确的时间检索正确的上下文,而非简单地获取语义相似内容。
压缩操作:使用对话摘要、工具输出压缩等技术精简内容。LangChain的实测数据显示,端到端摘要可以将115K token减少到60K,节省近50%的空间。
隔离操作:在多Agent架构中为子Agent分配独立上下文窗口,防止"上下文污染"。这种设计类似于微服务架构中的界限上下文概念。
LangChain还发现了一个有趣的现象:某些工具的功能纯粹是为了上下文管理。例如Claude Code的待办事项工具实际上不执行任何操作,它的存在只是为了强制Agent明确表述计划,在长流程中保持正轨。
8. 技术方案对比分析
8.1 上下文窗口管理策略
Manus和Cursor都采用了积极的窗口管理策略,但侧重点不同。Manus强调缓存优化和结构稳定性,而Cursor更注重动态发现。Anthropic则在系统提示设计上独树一帜,找到了过度工程与过于简化的平衡点。OpenAI提供了最全面的记忆基础设施,而Google则完全颠覆了窗口有限的假设。
8.2 信息检索机制演进
所有公司都在从静态预加载转向动态检索,但实现方式各异。Cursor的懒加载和文件接口最具创新性,实测效果也最好(46.9%的token节省)。Anthropic的运行时检索和Google的gist记忆则代表了两种不同的优化方向。
8.3 长期记忆实现对比
OpenAI的基于状态的记忆方案在个性化场景表现最佳,而LangChain的分类法则为开发者提供了清晰的选择框架。Manus的错误保留策略和Cursor的无损压缩展示了处理负面经验的两种有效方法。
9. 行业共识与开放问题
9.1 正在形成的技术标准
行业已经就几个关键原则达成共识:文件系统作为扩展记忆的价值;动态检索优于静态加载;保留错误记录的重要性;以及持久化计划文件对长任务的关键作用。这些共识正在成为新一代AI Agent的标准配置。
9.2 值得关注的争议点
几个技术争议尤为突出:工具管理应该采用Manus的logit屏蔽还是Cursor的懒加载;Google的长上下文路线能否成为主流;以及开发者在框架使用与原始原语间的选择平衡。这些争议反映了技术演进的活跃态势。
9.3 亟待解决的挑战
三个关键挑战尚未得到很好解决:会话记忆缺乏统一标准;上下文工程缺少评估基准;以及子Agent上下文隔离的决策依据仍然过于经验化。这些问题的解决将决定下一代AI Agent的能力上限。
10. 实践建议与未来展望
从行业领军者的演进历程中可以观察到一个有趣的现象:最好的Agent团队在不断简化他们的系统。Manus重写了五遍框架,每次都在删除而非增加功能。这提示我们:在模型能力快速提升的背景下,系统设计应该追求"少即是多"的哲学。
对于实践者,我们建议:首先明确自己的业务场景特征(工具调用频率、输入输出比等),然后选择匹配的技术路线。评估现有方案时,不要只看技术新颖性,更要关注与业务需求的契合度。最后,保持架构的演进能力——正如这些领先公司展示的,上下文管理技术还远未成熟,今天的优势策略可能明天就会过时。
未来几年,上下文管理技术可能会沿着三个方向发展:更精细的注意力控制机制、更智能的压缩算法,以及更紧密的硬件协同设计。无论哪种方向胜出,一个趋势已经明确:上下文管理正在从实现细节演变为AI Agent的核心竞争力。
