OpenAI首次公开点名:Kimi相关账户窃取16000次模型推理背后

一句话结论:OpenAI首次公开将一起协调性模型蒸馏攻击归因于Kimi母公司Moonshot AI,攻击持续数月、涉及16000次请求,但OpenAI同时强调攻击者未破解加密也未入侵数据库。事件既暴露了前沿模型「受保护推理」机制的安全边界,也成为大模型竞争进入安全博弈新阶段的重要节点。

事件始末:7月启动、16000次请求、目标锁定「受保护推理」

2026年9月30日北京时间18:30,OpenAI在官方博客发布长文,首次完整披露一起协调性模型蒸馏攻击的调查结论。攻击活动于7月1日正式启动,7月24日至25日出现高容量峰值:累计16000次请求使用相关提取模式,涉及超过4000名用户。进一步调查还发现,涉及相关提示模式活动的更大用户集群超过15000人。

攻击的核心目标是OpenAI模型的「受保护推理」(Protected Reasoning)——这是模型处理任务时产生的内部记录,可揭示最终答案中未包含的推理过程。攻击者的具体手法是:将一次对话中加密的推理内容复制到另一次对话,要求模型解密并转录其中的隐藏推理内容,从而实现蒸馏提取。OpenAI明确表示,攻击者未破解加密、未入侵数据库、未获取任何存储的用户对话数据,而是通过「操纵模型交互」使受保护推理以可见形式被复现。

归因Moonshot:OpenAI首次公开点名竞争方

这是本事件最具影响力的一个维度。OpenAI将核心攻击集群明确归因于与Moonshot AI(即Kimi开发商)相关联的账户,但同时指出「不确定所有观察到的操作者是否来自单一行为者」。这在AI行业极为罕见——主流厂商通常不会在公开渠道明确将安全攻击归因于竞争对手。

OpenAI已将相关发现通过Frontier Model Forum与行业合作伙伴分享,并通过政府信息共享渠道上报。在技术应对层面,OpenAI已关闭了允许重放其他用户加密推理的途径,并添加了检测流式输出暴露推理内容的检查。

同期,独立安全研究人员也负责任地向OpenAI披露了跨模型及会话压缩漏洞,涉及不同模型架构间的类似风险。这表明「受保护推理」被蒸馏提取并非单一厂商的问题,而是整个行业在前沿模型安全层面面临的共同挑战。

「受保护推理」为何重要:大模型安全的新边界

传统观念认为,只要不直接入侵数据库或破解加密,用户数据就是安全的。但这起事件颠覆了这一假设的关键前提——即使加密完好、数据库未被动过,模型的内部推理过程本身就可以通过精心构造的交互序列被「诱骗」出来。

「受保护推理」是前沿模型在复杂推理任务中生成的高价值中间产物,其价值不仅在于最终答案,更在于推理链条中可能包含的专有技术思路、训练知识痕迹以及对齐策略的间接暴露。对于竞争者而言,获取大量此类推理数据理论上可以辅助训练出能力接近的模型。

OpenAI坦承,随着前沿模型能力不断提升,此类对抗性蒸馏尝试将愈发复杂。这一判断意味着,「受保护推理」的安全保护将成为下一阶段AI安全研究的重点方向之一。

行业影响:竞争、安全与信任的多重博弈

从商业竞争角度看,这是大模型头部厂商之间关系恶化的重要信号。OpenAI首次公开点名竞争对手涉及安全攻击,而非通过私下渠道处理,表明双方信任已经降至相当低的水平。

从监管层面看,OpenAI主动上报政府信息共享渠道的举动,显示出AI安全事件正在进入政府监管视野。这类涉及前沿模型能力泄露的安全事件,未来可能触发更严格的报告义务和监管要求。

从技术行业影响看,「受保护推理」这一机制被攻破的影响范围远超OpenAI一家——Anthropic、Google DeepMind等拥有类似机制的厂商均需重新评估其安全性。Frontier Model Forum内的信息共享机制能否有效建立行业统一防线,值得持续关注。

维度 数据
攻击启动时间 2026年7月1日
高峰时间 7月24日至25日
累计请求次数 16,000次
涉及用户数(核心集群) 4,000+
涉及用户数(相关集群) 15,000+
攻击目标 模型「受保护推理」内容
数据泄露 无(未破解加密/未入侵数据库)
归因 Moonshot AI(Kimi开发商)
技术修复 关闭加密推理重放途径+增加检测

FAQ

OpenAI的「受保护推理」是什么?

「受保护推理」是前沿模型在处理复杂推理任务时生成的内部中间记录,其内容不会出现在模型给用户的最终回复中,但理论上可以通过特殊构造的对话序列被间接提取。这次攻击的核心就是利用这一机制漏洞。

Kimi(Moonshot AI)方面有何回应?

截至发稿,Moonshot AI尚未公开回应OpenAI的指控。OpenAI在博客中表示其归因基于证据但仍有不确定性,且不确定所有操作者是否来自同一行为者。

普通用户的数据是否泄露?

OpenAI明确表示,攻击者未获取任何存储的用户对话数据,未破解加密,也未入侵数据库。普通用户无需恐慌,但这一事件提示前沿模型安全机制存在此前未被充分重视的漏洞。

相关阅读