科技·商业·财经

长任务“失忆跑题”难题何解?主流框架以四台“发动机”助力智能体“稳行”

   时间:2026-09-14 14:16 作者:柳晴雪

在智能体技术领域,大模型在执行长任务时频繁“失忆”、偏离初始目标的问题长期存在。这一困扰行业的难题,根源或许不在模型本身,而在于支撑模型运行的“执行框架”。根据AWS发布的自主云编程智能体设计指南,浅层智能体在处理长周期任务时,容易因上下文溢出、外部干扰而偏离主题,且难以维持稳定状态。而解决这一问题的关键,在于一套被称为“harness”的底层管理系统,它负责统筹模型之外的所有运行环节。

一项针对主流框架的最新研究揭示了这些系统的运作机制。LangChain Deep Agents、Claude Code、Manus、OpenAI Codex和Amazon Bedrock AgentCore等框架,通过构建四项核心功能——上下文预算控制、信息压缩、待办状态追踪和跨会话记忆管理——将浅层智能体升级为能够应对复杂长任务的深度智能体。这一技术路径颠覆了传统认知:单纯扩大上下文窗口并不能解决问题,反而可能加剧模型的不稳定性。

Chroma的Context Rot报告对18款大模型进行评估后发现,在简单检索任务中,输入内容越长,模型表现越不可靠。Anthropic团队解释称,注意力机制在处理n个token时会生成n²个关联关系,每个新增token都在消耗有限的“注意力预算”,导致上下文成为边际效益递减的资源。Manus团队的实践数据进一步印证了这一点:典型任务需要调用约50次工具,输入输出比例高达100:1,初始指令在持续运行中会逐渐漂移至上下文窗口中部——这正是记忆衰退最严重的区域。

第一项核心功能是上下文预算与动态卸载机制。Deep Agents设定了严格的资源限制:当工具返回内容超过20000token时,系统自动将完整内容存入文件系统,仅保留路径和前10行预览;会话上下文占用达到窗口85%时,旧编辑记录会被压缩为指针。Claude Code采用类似策略,在加载阶段即限制记忆容量为200行或25KB,工具调用模式默认仅显示名称,按需加载详细内容。AWS AgentCore的解决方案更为激进:协调器并行启动3个浏览器子智能体,每个运行在独立微型虚拟机中,分析子智能体仅接收结构化结果,使整体处理时间缩短至串行模式的1/3。

第二项突破在于信息压缩技术。当卸载机制不足以应对时,框架会通过摘要重启对话。Claude Code的压缩算法会保留架构决策和未解决漏洞等关键信息,丢弃冗余输出,并在压缩后重新读取最近修改的5个文件,将技能正文重新注入上下文。该系统同时将完整原始记录存入磁盘,确保被摘要的信息可追溯。Deep Agents将目标保护机制结构化,摘要文档明确划分会话意图、已生成产物和下一步计划三个字段。这项技术已下沉至API层:OpenAI Responses API通过`compact_threshold`参数提供服务端压缩,Codex正是依赖此功能支撑长编程任务;Claude平台则允许用户自定义压缩指令。

第三项创新是待办状态管理与“目标强化”机制。Manus采用最直观的方式——创建`todo.md`文件,通过持续更新任务清单将目标固定在上下文末尾,防止被后续信息淹没。但这种设计并非绝对有效:Deep Agents在2026年7月的v0.7版本中,因评估显示关闭待办功能可降低20%成本且奖励值略有提升,将其改为可选组件;LangChain则建议对长任务、弱模型或需要展示进度的界面保持该功能启用。

第四项关键技术是跨会话记忆管理。Claude Code在每次压缩后都会从磁盘重新加载CLAUDE.md文件和自动记忆库;AgentCore Memory通过后台抽取策略,使协调器能够直接调用历史研究成果而非重复分析。然而苏黎世联邦理工的研究泼了冷水:AGENTS.md等上下文文件虽能维持任务连续性,但会使推理成本增加20%-23%,每次重载都相当于对注意力预算征收固定税费。为此Claude Code建议将CLAUDE.md文件控制在200行以内。

研究团队强调,框架的“目标保持”能力必须通过强制压缩测试来验证。最需要警惕的失败场景是:智能体在摘要后立即要求澄清任务细节,或错误宣布任务已完成。这表明,让智能体在长任务中保持方向感,关键不在于模型规模,而在于底层框架对四项核心功能的精细调控。

 
 
更多>同类内容
全站最新
热门内容