Meta超级智能实验室联合华盛顿大学、MIT和Trillium Labs于2026年9月29日发布论文《Context Language Models》(arXiv:2609.37725),提出一种激进的上下文管理新架构:把模型的上下文镜像成一个可写文件,让模型用普通Bash命令自由地追加、改写、删除自己的上下文——无需外部框架在阈值触发时介入摘要或截断。这是语言模型第一次能够像编辑普通文件一样主动管理自己的记忆。
核心机制:把上下文变成可写文件
传统Agent的上下文管理由外部框架主导:当上下文接近 token 上限时,框架强制触发摘要或直接截断。这是一种”harness决定”模式——工程师预先定义何时压缩、压缩多少,模型只是被动接受。
CLM的思路完全不同:上下文被镜像成一个虚拟文件系统中的文件,模型通过标准的Bash操作(`read`、`append`、`edit`、`delete`)来管理它。模型可以自发创建内部”笔记”角色、维护多智能体记分板、编写可复用的压缩函数——这些都是模型自己的决策,而不是工程师预设的行为。
配套的后缀缓存复用技术(Suffix Cache Reuse)解决了上下文编辑破坏KV缓存的问题,使服务器端计算降低35%。
基准测试:零样本即超SOTA
CLM的实验数据相当有说服力:
- BrowseComp-Plus深度研究基准:Qwen3.6-27B直接应用,准确率从53.4%提升至59.4%,提升11.4个百分点;前缀复用FLOPs减少21.5%。
- 12小时EdgeBench任务:准确率再提升5%,FLOPs减少59%。
- 24小时六仓库多智能体集群:同等算力下加速比提升65%。
- RL训练小模型:Qwen3.5-9B经在线强化学习后,BrowseComp-Plus从28.8%升至42.5%,每问题算力仅1.34 PFLOPs(对比摘要基线的2.19 PFLOPs)。
Bitter Lesson推进到上下文层
这篇论文的本质是把Rich Sutton”Bitter Lesson”理念推进到了上下文管理层:凡是人类手工设计的策略,最终都会输给可学习的通用方法。
此前从固定阈值压缩(Cursor/Codex)、到Self-Compact、再到ACM的外部记忆检索,所有方法的共同点是”harness决定”——框架替模型做上下文决策。CLM把这个决策权完全交还给模型。
涌现行为最能说明问题:模型自发维护多智能体记分板、自发创建内部”笔记”角色、自发编写可复用压缩函数——没有一个是工程师预设的。这种”自发”意味着模型在学会”如何管理自己的记忆”,而不是”按照工程师的规则管理记忆”。
对LangChain们的冲击
CLM对Agent框架开发者的影响同样深远:
当模型开始自主管理上下文时,LangChain、AutoGPT等抽象层的核心价值——上下文管理与记忆组织——将被直接侵蚀。这些框架在”上下文足够短”的时代解决了开发者手动管理的难题,但CLM让模型自己来完成这件事。
框架的出路或许是向更薄的方向演化:从”管理记忆”退守到”提供工具集成与工作流编排”,把记忆管理的决策权让渡给模型自身。当然,这也意味着框架需要重新定义自己的不可替代价值。
CLM关键性能数据
| 指标 | 基线 | CLM结果 | 变化 |
|---|---|---|---|
| BrowseComp-Plus准确率 | 53.4% | 59.4% | +11.4% |
| 前缀复用FLOPs | 100% | 78.5% | -21.5% |
| 12h任务FLOPs | 100% | 41% | -59% |
| 24h多Agent加速比 | 1x | 1.65x | +65% |
| Qwen3.5-9B RL后准确率 | 28.8% | 42.5% | +13.7% |
| 每问题算力(9B RL) | 2.19 PFLOPs | 1.34 PFLOPs | -39% |
| 服务器计算(Suffix Cache) | 100% | 65% | -35% |
局限与风险
论文也坦承了CLM的局限:可写上下文带来了新的攻击面——prompt注入可以持久化于编辑后的上下文中,且9B级小模型零样本下自主管理上下文会掉分,需要强化学习训练才能掌握这一能力。CLM的安全部署需要编辑审计与回滚机制作为配套。
常见问题
Q:CLM与之前的上下文压缩方法有什么本质区别?
A:本质区别在于决策主体。传统方法(固定阈值摘要、ACM外部检索等)由外部框架决定何时压缩、压缩什么;CLM把这一决策权完全交给模型本身,让模型像处理普通文件一样处理自己的上下文。这是从”harness决定”到”模型自主”的转变。
Q:这对普通开发者有什么影响?
A:使用LangChain等框架构建Agent的开发者,需要重新评估框架的核心价值。如果框架主要价值在于上下文管理,CLM让这一层变得不再必需。更实际的影响是:未来选择Agent框架时,需要看它是否支持CLM式的自主记忆管理,而不是自带一套记忆管理逻辑。
Q:CLM的安全风险如何应对?
A:论文提出的解法是”编辑审计与回滚机制”——对模型编辑上下文的行为进行记录,允许在发现异常时回滚到安全版本。此外,prompt注入防护的重要性进一步提升,因为注入代码现在可以持久存在于模型的长期上下文中。
相关阅读:
- 《纽约时报》揭OpenAI安全黑洞:员工预警遭无视,GPT-6.1 Astra取消发布
- Anthropic与SpaceX签845亿美元算力协议:半年翻19倍
- AWS开源Strands Decider 2B:亚100毫秒智能体路由
延伸阅读
- 美国议员提最严AI监管法案:递归自我改进被禁,OpenAI/谷歌等纳入联邦监管2 天前
- OpenAI 明日重启 200 美元 Pro 订阅:API 配额减半,取消 5 小时限制4 天前
- OpenClaw 2.0 正式发布:史上最大更新,933人贡献16000个PR,龙虾全面进化1 月前
- ChatGPT Work接管企业数据:从看报表到AI驱动可执行动作2 周前
