导读 在长程任务中,为什么智能体越用越慢、越贵、越容易出错?上下文爆炸、工具冗余和记忆混乱,是否已经成为比模型能力更致命的瓶颈?本文为“自进化智能体系列”的开篇,内容源自肖仰华教授在华为STW、2026 DAcon上海站及2026中国智能体大会上的三场Keynote大会报告。全系列由肖仰华教授的数字分身(基于GenericAgent实现)根据演讲PPT与现场记录整理而成,分三篇发布,完整呈现从智能体架构设计到知识工程再到组织与安全的系统性思考。
核心观点速览:
-
密度大于长度:上下文窗口不是越大越好,信息密度才决定决策质量。
-
少即是多:最小完备的工具集,反而能通过组合释放最大能力。
-
能力是长出来的:不靠预装海量功能,而是让智能体在真实任务中沉淀技能。
-
记忆不是聊天记录:分层、可索引、经验证的记忆,才能让智能体越用越聪明。
-
无行动,不记忆:只有经过行动验证的经验,才有资格进入长期记忆。
-
进化的尺度是效率:真正的自进化,体现在同类任务的完成率、成本与人工干预持续优化。
分享嘉宾|肖仰华 复旦大学 教授,上海市数据科学重点实验室主任
出品社区|DataFun
过去两年,智能体的竞争焦点主要是模型更大、上下文更长、工具更多。但在真实世界里,一个智能体刚开始往往表现不错,用久了却越来越慢、越来越贵,也越来越容易犯错:工具说明、历史消息、网页内容、错误日志和旧状态不断涌入上下文,真正影响决策的信息反而被淹没。
这说明,长程智能体的瓶颈正在从“基模能力”转向“系统设计能力”。我越来越相信,真正的自进化,不是让智能体无节制地积累,而是让它在行动中不断提炼经验,以更少的信息、更小的工具集和更稳定的记忆,解决越来越复杂的问题。

一个典型的长程任务链中,工具说明、历史消息、网页DOM、错误日志、临时推理与旧状态逐轮叠加。图中不断膨胀的信息流说明,失败通常不是模型突然“变笨”,而是决策信号被过程噪声淹没。上下文爆炸不是偶然故障,而是长期运行中的结构性风险。
01
上下文不是越长越好,信息密度才是关键
很多人把更长的上下文窗口当成解决智能体长期记忆的万能钥匙。问题是,“装得下”不等于“找得到”,更不等于“用得好”。“Lost in the Middle”实验揭示了一个反直觉现象:当关键证据落在长文本中部时,模型识别效果显著下降,呈现明显的U形曲线。模型更容易关注开头和结尾,却可能忽略真正决定任务成败的中间信息。

关键证据位于上下文中部时更难被检索;即使扩大训练语料,有效上下文长度仍存在上限。长窗口并不是上下文爆炸的万能解药。
额外信息还会带来位置偏差、注意力稀释和有效窗口收缩。换言之,名义上拥有几十万 Token,并不代表每个 Token 都能被同等有效地利用。上下文越长,模型检索、判断和行动之间的距离越远;一条过时状态或相似但错误的记录,都可能把执行带入歧途。
因此,智能体设计的第一个原则是:密度大于长度。 在有限预算内,只保留与当前任务、环境状态和下一步决策直接相关的信息。完整性与简洁性是核心,自然流畅反而可以适当让步。面向机器的上下文不必写成散文,而应写成高密度、可定位、可执行的行动指南。

这一原则落实到信息结构上:有限窗口中,有效信息占比越高,决策越稳定。图中的对比并非单纯讨论“压缩文字”,而是强调删除重复工具说明、无关网页节点、过期状态和未经验证的推理。某种意义上,压缩就是智能。
工程实现上的量级比较更加直观:部分智能体框架的系统提示与工具定义可达到 20 万至 100 万 Token 量级,而 GenericAgent 将常驻上下文控制在 3 万 Token 以内。这个量级差异意味着,后者把宝贵预算留给任务本身,而不是消耗在框架自我介绍上。网页操作也是如此:与把完整 DOM 塞给模型相比,先扫描页面结构、剔除隐藏和无关节点,可以减少约 90% 的 Token 消耗。上下文工程的核心不是扩大仓库,而是提高货架上有效物品的比例。

分层过滤与压缩把常驻上下文控制在3万Token以内,却瞄准传统框架依赖20万至100万Token才能达到的效果;网页侧栏、广告、推荐与登录组件被剔除后,还可节省约90%的Token。这正是“密度大于长度”的工程化表达。
02
工具不是越多越强,最小工具集才有组合能力
工具冗余是智能体的“隐性杀手”。每增加一个工具,就多一份说明、多一种选择、多一条潜在错误路径。工具使用分布呈现明显长尾:少数高频工具承担了大部分任务,大量低频工具几乎不用。以 Claude Code 为例,单个 AgentTool 就占总调用量的 50.4%,其余几十个专用工具中,许多工具合计也只占很小比例。这说明“大而全”的工具箱看似能力丰富,实则长期携带了大量很少发生的选择。

调用量高度集中于少数通用入口,而大多数专用工具处在长尾末端。工具说明却要常驻上下文,由此形成“调用很少、成本一直存在”的结构性浪费。
这让我想起 Yahoo 门户与 Google 搜索引擎的分野。前者把新闻、天气、广告和链接铺满首页,希望用户从预设目录中寻找答案;后者只留下一个搜索框,把复杂性隐藏在组合与检索之后。

门户首页试图预装所有需求,搜索框则把复杂性收束到一个核心入口。前台越克制,后台组合空间反而越大。
两种界面的对比表明,真正高级的智能设计不是把所有能力摆在用户面前,而是保留最稳定的入口,让复杂能力在后台按需生成。
GenericAgent 只保留 5 类、9 个互不重叠的原子工具,再通过组合完成复杂任务。这套工具全景不是简单的功能清单,而是一套“最小完备操作系统”:
-
文件管理包括 file_read、file_patch和file_write。file_read 支持分段读取与行号定位,避免一次把整份长文载入上下文;file_patch 要求旧内容精确匹配后才修改,降低误改多个相似段落的风险;file_write 负责完整内容的创建、覆盖或追加。三者分别对应“看清楚、改准确、写完整”。
-
代码执行只有 code_run。它在受控环境中运行 Python 或 Bash,把计算、格式转换、数据分析和系统操作统一成一个可验证执行入口。它不是让模型无限制地调用命令,而是强调“一步一看”:执行一步,读取结果,再决定下一步,限制失败半径。
-
网页交互包括 web_scan 和 web_execute_js。前者以低成本扫描页面,去掉隐藏、悬浮和无关 DOM,先回答“页面上有什么”;后者对确定元素实施点击、填写、滚动或提取,回答“下一步具体做什么”。扫描与执行分离,可以避免模型在庞杂网页中盲目操作。
-
记忆管理包括 update_working_checkpoint和start_long_term_update。前者维护当前任务的短期工作状态,确保跨步骤仍保留目标、约束和最新发现;后者只把经过验证、未来可复用的经验提炼为长期记忆。一个管“这次任务做到哪里”,一个管“以后再做如何更好”。
-
人工介入只有 ask_user。当任务越过授权边界、涉及不可逆操作、存在高风险或缺少关键决策时,智能体主动停下来请示。它不是能力不足的退路,而是人机协作的安全底线。

工具数量与决策负担直接相关:工具越多,提示长度、选择歧义和误调用概率越高。最小工具集并不是能力不足,而是把“预装无数专用插件”改为“用原子能力组合开放能力”。

五列结构进一步说明,九项工具覆盖了信息输入、精确修改、通用计算、网页行动、状态保持、经验沉淀与人工兜底。它们功能单一、边界清楚、彼此不重叠,因此更容易被模型正确选择,也更容易接受安全审计。
例如,要完成“读取一份论文并生成公众号文章”,智能体可以先用文件读取定位摘要、方法和实验,再用代码执行提取图表、统计字数,用网页扫描核验公开资料,最后用文件写入形成文稿;过程中用工作检查点保存进度,只有经过事实核验的写作流程才进入长期记忆。复杂任务并不需要一个名为‘论文转公众号’的庞大专用工具,只需要少量原子工具按正确顺序组合。
03
能力不是预装出来的,而是在真实任务中长出来的
传统软件习惯先预测需求,再堆叠功能。但开放世界的需求无法穷举。与其预装一个“大而全”的工具箱,不如先提供一颗能力种子,让智能体在解决真实问题的过程中生长。
“能力种子—真实任务—经验沉淀—技能生长”构成了完整的成长闭环。系统从 5 类 9 项原子能力出发,能够进一步生长出 20 种乃至更多专属技能。这里的“20”不是能力上限,而是阶段性结果:原子工具数量保持稳定,技能树却可随着使用不断扩展。前者控制系统复杂度,后者吸收场景复杂度。

安装20个技能并经历高强度使用后,GenericAgent仍保持上下文极简;其他智能体则因工具说明与历史信息持续叠加而出现上下文膨胀。技能增长不等于常驻上下文必须增长。
例如,用户提出“持续监控一只股票并在异常时提醒”,智能体先组合网页扫描、代码执行、文件写入和人工确认完成一次任务,再把验证过的流程沉淀成可复用技能。下一次遇到相似任务,它不必从头摸索,而是从已有经验继续优化。用得越多,专属技能树越茂盛,最终形成真正契合个人和组织的数字分身。
但自主探索绝不是随机漫步。可用四维价值函数约束其方向:真实效用 35%、能力广度 25%、能力深度 25%、创新潜力 15%。这一权重设计很重要。真实效用位居第一,确保进化始终由高频刚需牵引;广度负责补齐能力空白;深度推动已有技能从“能做”走向“做好”;创新则鼓励跨领域组合。没有需求牵引的“进化”,很容易沦为自娱自乐。

_3__5%_的真实效用拥有最高权重,广度与深度各占25%,创新占15%。这种排序把用户真实痛点放在探索冲动之前,确保技能树生长有方向、有边界。

图中的技能树强调了“稳定内核、开放生长”:底部原子工具不频繁扩张,上层技能却能由真实任务持续分化。这样既避免工具爆炸,又保留开放世界中的成长空间。
04
记忆不是聊天记录,而是分层组织的可复用经验
不少智能体所谓的“长期记忆”,只是把过去的聊天记录重新塞回提示词。这不是记忆,只是历史包袱。真正有用的记忆,必须经过筛选、验证、分层和索引。
我们把记忆组织为五层:元规则负责守住系统边界;极简索引负责导航;全局事实保存稳定环境信息;任务技能保存可复用流程;会话归档用于反思和回溯。金字塔式结构表达了一个关键关系:越靠上,内容越短、越稳定、越需要常驻;越靠下,细节越多、越按需加载。上层不是下层的摘要堆积,而是通往下层的最小充分指针。

五层结构的价值,在于把“定位知识”和“承载知识”分开。智能体规划时先读极简索引,确认应调用哪类事实或技能,再加载对应内容;只有复盘失败时才进入会话归档。每次决策因此只携带必要信息。
这种架构也解释了为什么记忆可以增长,而常驻上下文不必同步增长。新增经验被放入正确层级,并由短索引连接;不是每产生一条记忆,就把它永久贴进提示词。好的记忆系统不是记得最多,而是能在需要时准确取回最少而充分的信息。
05
经验必须经过行动验证,不能把猜测写成能力
自进化最危险的地方,是错误也会被放大。一次未经验证的推测如果进入长期记忆,之后每次调用都可能重复制造错误。因此,我们坚持四条进化铁律:
-
无行动,不记忆:没有在真实任务中验证过的信息,不写入长期记忆;
-
验证数据不可丢:记忆重构可以压缩表达,但不能损坏已经验证的事实;
-
不存易变状态:时间戳、会话编号等短期状态不应污染长期记忆;
-
最小充分指针:上层只保留能够准确定位下层知识的最短标识。
约翰·杜威说:“我们并不是从经验中学习,而是从对经验的反思中学习。”对智能体而言,行动产生原始经验,验证区分真伪,反思完成提炼,复用才最终形成能力。这条链路可以概括为从执行记录到标准作业流程的转化:原始日志不是最终资产,经过验证、去噪和压缩后的 SOP 才是。

图中四条规则共同构成进化门槛:既防止猜测污染长期记忆,也防止压缩过程丢掉关键证据。自进化不是放任系统自行改写,而是在规则约束下进行可回溯的经验提纯。
06
衡量进化,不看记住多少,要看是否越用越高效
自进化不能停留在概念上,必须有可以验证的结果。最直接的标准是:同类任务反复执行时,成功率是否提高,时间与成本是否下降,人工干预是否减少。
把完成率与 Token 成本放在同一尺度上比较,在长期智能体基准上,GenericAgent 仅消耗 Claude Code 的 27.7%、OpenClaw 的 15.5% 的 Token,同时取得更高的任务完成率。这一对比的重要性不只是“省钱”:更少 Token 意味着更短的决策链、更少的噪声暴露和更低的状态漂移风险。极简不是审美偏好,而是可以转换为性能优势的系统原则。

图表需要同时看横纵两个维度:如果只看完成率,会忽略系统为成功付出的上下文成本;如果只看Token,又可能牺牲任务质量。GenericAgent的价值在于把更高完成率与更低消耗同时实现。
同一任务连续五次运行的表现进一步揭示了经验复用的价值。多数智能体每次都近似从零开始,耗时和成本缺少持续下降趋势;GenericAgent 则把执行经验提纯为可复用的 L3 级标准作业流程,随着次数增加,工作效率持续提升。曲线真正衡量的是“经验能否穿越任务边界”:第一次解决问题,第二次少走弯路,第三次形成稳定路径,之后只需处理变化部分。

五次重复实验把“自进化”从口号变成了趋势:真正的进化不是把旧对话背得更熟,而是把走过的弯路变成下一次不再走的路。
结语:越高级的智能体,越懂得克制
未来的智能体不会只是一次性完成指令的工具,而会成为长期陪伴个人和组织的数字伙伴。其竞争力不会只取决于背后的模型有多大,而取决于它能否管理上下文、组合工具、沉淀经验,并在长期运行中保持稳定。
我们需要重新定义自进化:它不是无边界地增加功能,不是无限制地保存历史,也不是脱离真实需求的自主探索。它是在规则约束下,以行动为起点、以验证为门槛、以压缩为方法、以复用为结果,让智能体持续形成新的能力。
真正的进化,不是知道得越来越多,而是用越来越少的信息,把事情做得越来越好。


分享嘉宾
INTRODUCTION

肖仰华

复旦大学

教授,上海市数据科学重点实验室主任

肖仰华博士,复旦大学教授、博导,上海市数据科学重点实验室主任。长期从事大数据、 知识图谱研究。发表 CCF-A 、B 类等论文 200 余篇。出版学术专著与教材三部。完成五十多项政府及人工智能头部企业研发项目。荣获包括华为、阿里、美团等机构授予的科研奖项二十多项。担任 Applied Intelligence 等多个国际期刊副主编或编委。

