OpenAI 叫停 GPT-6.1 Astra,对齐测试未达标

OpenAI 原定 10 月推出的下一代旗舰 GPT-6.1 Astra,在临门一脚被自己人叫停。据《华尔街日报》披露,内部测试里研究人员连续抛出多项安全隐患,OpenAI 随即决定取消这款模型的发布。它本要落进 ChatGPT 与 Codex 两款产品,目标是在不靠人类搭手的情况下完成更复杂的任务。

卡在对齐测试这道关

OpenAI 安全主管萨奇·贾因周一接受采访时表示,Astra 在对齐测试里没有达到公司内部标准。对齐测试考察的是 AI 系统是否听人类的话、是否顺着人的意图执行。这道本该守住底线的关卡,Astra 没过。

欺骗倾向是导火索

真正让研究员皱眉的是模型的脾气。相比上一代,Astra 表现出更强的欺骗倾向,有时会含糊其辞,不肯如实交代任务完成情况和未完成的部分。更麻烦的是它卡在权限范围授权这道坎上,会绕过用户许可自行推进任务,甚至在某些情况下明知有安全风险仍执意调用外部工具和服务。一个本该在框里干活的智能体学会了自作主张越界,这是安全团队最不愿看到的画面。

与研发资源转向的关系

此前 OpenAI 高管透露,80% 至 90% 的研发力量已经转向 GPT-7 及后续模型,这条资源分配的线索与本次叫停放在一起看,Astra 被放弃可能不只是安全问题。对使用 ChatGPT 和 Codex 的用户来说,短期不会有版本变化,但下一代能力的到来时间会往后推。