OpenAI公开披露安全事件:Kimi相关账户窃取16000次模型推理

OpenAI于9月30日(北京时间18:30)发布官方博客,披露一起协调性模型蒸馏攻击事件的完整调查结论,并将核心攻击集群归因于与Moonshot AI(Kimi开发商)相关联的账户。

攻击规模:16,000次请求、4,000+用户

OpenAI在博文中透露,攻击活动于7月1日正式启动,7月24日至25日出现高容量峰值:累计16,000次请求使用相关提取模式,涉及超过4,000名用户。进一步调查发现,相关提示模式活动还涉及超过15,000名用户的更大集群。

攻击的核心目标是OpenAI模型的”受保护推理”(Protected Reasoning)——模型处理任务时的内部记录,可揭示最终答案中未包含的信息。攻击者将一次对话中加密的推理内容复制到另一次对话,要求模型解密并转录其中的隐藏推理,从而实现蒸馏提取。

OpenAI明确表示,攻击者未破解加密、未入侵数据库、未获取存储的用户对话,而是通过”操纵模型交互”使受保护推理以可见形式被复现。

归因Moonshot:OpenAI首次公开点名竞争方

OpenAI将核心攻击集群归因于与Moonshot AI相关联的个体,但同时指出”不确定所有观察到的操作者是否来自单一行为者”。这是OpenAI首次在公开博客中将安全攻击明确归因于另一家主流AI厂商,在业内极为罕见。

OpenAI已将相关发现通过Frontier Model Forum与行业合作伙伴分享,并通过政府信息共享渠道上报,同时关闭了允许重放其他用户加密推理的途径,添加了检测流式输出暴露推理内容的检查。

独立研究人员披露漏洞

除协调性攻击外,独立安全研究人员也负责任地向OpenAI披露了跨模型及会话压缩漏洞。OpenAI表示,将继续加强技术保护、检测执法和威胁信息共享,并坦承随着前沿模型能力提升,此类对抗性蒸馏尝试将愈发复杂。