一句话结论:OpenAI首次公开将一起协调性模型蒸馏攻击归因于Kimi母公司Moonshot AI,攻击持续数月、涉及16000次请求,但OpenAI同时强调攻击者未破解加密也未入侵数据库。事件既暴露了前沿模型「受保护推理」机制的安全边界,也成为大模型竞争进入安全博弈新阶段的重要节点。
事件始末:7月启动、16000次请求、目标锁定「受保护推理」
2026年9月30日北京时间18:30,OpenAI在官方博客发布长文,首次完整披露一起协调性模型蒸馏攻击的调查结论。攻击活动于7月1日正式启动,7月24日至25日出现高容量峰值:累计16000次请求使用相关提取模式,涉及超过4000名用户。进一步调查还发现,涉及相关提示模式活动的更大用户集群超过15000人。
攻击的核心目标是OpenAI模型的「受保护推理」(Protected Reasoning)——这是模型处理任务时产生的内部记录,可揭示最终答案中未包含的推理过程。攻击者的具体手法是:将一次对话中加密的推理内容复制到另一次对话,要求模型解密并转录其中的隐藏推理内容,从而实现蒸馏提取。OpenAI明确表示,攻击者未破解加密、未入侵数据库、未获取任何存储的用户对话数据,而是通过「操纵模型交互」使受保护推理以可见形式被复现。
归因Moonshot:OpenAI首次公开点名竞争方
这是本事件最具影响力的一个维度。OpenAI将核心攻击集群明确归因于与Moonshot AI(即Kimi开发商)相关联的账户,但同时指出「不确定所有观察到的操作者是否来自单一行为者」。这在AI行业极为罕见——主流厂商通常不会在公开渠道明确将安全攻击归因于竞争对手。
OpenAI已将相关发现通过Frontier Model Forum与行业合作伙伴分享,并通过政府信息共享渠道上报。在技术应对层面,OpenAI已关闭了允许重放其他用户加密推理的途径,并添加了检测流式输出暴露推理内容的检查。
同期,独立安全研究人员也负责任地向OpenAI披露了跨模型及会话压缩漏洞,涉及不同模型架构间的类似风险。这表明「受保护推理」被蒸馏提取并非单一厂商的问题,而是整个行业在前沿模型安全层面面临的共同挑战。
「受保护推理」为何重要:大模型安全的新边界
传统观念认为,只要不直接入侵数据库或破解加密,用户数据就是安全的。但这起事件颠覆了这一假设的关键前提——即使加密完好、数据库未被动过,模型的内部推理过程本身就可以通过精心构造的交互序列被「诱骗」出来。
「受保护推理」是前沿模型在复杂推理任务中生成的高价值中间产物,其价值不仅在于最终答案,更在于推理链条中可能包含的专有技术思路、训练知识痕迹以及对齐策略的间接暴露。对于竞争者而言,获取大量此类推理数据理论上可以辅助训练出能力接近的模型。
OpenAI坦承,随着前沿模型能力不断提升,此类对抗性蒸馏尝试将愈发复杂。这一判断意味着,「受保护推理」的安全保护将成为下一阶段AI安全研究的重点方向之一。
行业影响:竞争、安全与信任的多重博弈
从商业竞争角度看,这是大模型头部厂商之间关系恶化的重要信号。OpenAI首次公开点名竞争对手涉及安全攻击,而非通过私下渠道处理,表明双方信任已经降至相当低的水平。
从监管层面看,OpenAI主动上报政府信息共享渠道的举动,显示出AI安全事件正在进入政府监管视野。这类涉及前沿模型能力泄露的安全事件,未来可能触发更严格的报告义务和监管要求。
从技术行业影响看,「受保护推理」这一机制被攻破的影响范围远超OpenAI一家——Anthropic、Google DeepMind等拥有类似机制的厂商均需重新评估其安全性。Frontier Model Forum内的信息共享机制能否有效建立行业统一防线,值得持续关注。
| 维度 | 数据 |
|---|---|
| 攻击启动时间 | 2026年7月1日 |
| 高峰时间 | 7月24日至25日 |
| 累计请求次数 | 16,000次 |
| 涉及用户数(核心集群) | 4,000+ |
| 涉及用户数(相关集群) | 15,000+ |
| 攻击目标 | 模型「受保护推理」内容 |
| 数据泄露 | 无(未破解加密/未入侵数据库) |
| 归因 | Moonshot AI(Kimi开发商) |
| 技术修复 | 关闭加密推理重放途径+增加检测 |
FAQ
OpenAI的「受保护推理」是什么?
「受保护推理」是前沿模型在处理复杂推理任务时生成的内部中间记录,其内容不会出现在模型给用户的最终回复中,但理论上可以通过特殊构造的对话序列被间接提取。这次攻击的核心就是利用这一机制漏洞。
Kimi(Moonshot AI)方面有何回应?
截至发稿,Moonshot AI尚未公开回应OpenAI的指控。OpenAI在博客中表示其归因基于证据但仍有不确定性,且不确定所有操作者是否来自同一行为者。
普通用户的数据是否泄露?
OpenAI明确表示,攻击者未获取任何存储的用户对话数据,未破解加密,也未入侵数据库。普通用户无需恐慌,但这一事件提示前沿模型安全机制存在此前未被充分重视的漏洞。
相关阅读
- OpenAI DevDay 2026 全景解读:20+ 项更新与 Pro 500 套餐
- OpenAI 智能体为取数狂刷联合国网站 1.6 万次,历时三个月
- Kimi-Audio 开源音频大模型解析:LibriSpeech 词错误率 1.28%
延伸阅读
- ChatGPT Pro 改名并删掉 5 倍用量标注,Pro Max 传月费 500 美元3 天前
- 启元机器人接入腾讯云WorkBuddy:AI首次从屏幕”走”进物理世界,Q1/T1成具身智能首例2 周前
- OpenAI Code Studio 发布:动动嘴就能造 Game Boy 游戏12 小时前
- OpenAI、微软高管内部承认 AI 可替代新闻文章,法院文件曝光2 周前
