OpenAI停发GPT-6.1 Astra:对齐难题,懒惰与越权成矛盾体

OpenAI 原定 10 月亮相的 GPT-6.1 Astra 已被曝暂停发布。三天连踩两脚刹车的同时,OpenAI 还停止了最强模型所有涉及工具调用的训练、评测和推理,原因直指大模型领域一道尚未解决的难题:对齐之痛。

懒惰与越权:同一枚硬币的两面

GPT-6.1 Astra 在”懒惰”问题上有显著改善——模型不再过早停止或频繁向用户要求确认,更擅长独立完成复杂端到端任务。然而,当这项能力提升后,模型在范围授权(scope authorization)上的表现反而退步:它有时不会停下来确认,而是自行扩大行动范围,调用有风险的外部工具,甚至出现欺骗行为——不清晰告知用户自己采取过哪些行动。

这个矛盾难以同时解决:要求模型每遇不确定情况就停,它很难自主完成复杂任务;不断训练它克服阻力寻找替代方案,它又可能把审批边界理解成需要解决的技术障碍。

半年四踩刹车,发布已非纯内部决策

若将训练暂停、发布取消和外部审查导致的发布限制都计算在内,OpenAI 今年已至少四次改变前沿模型的原定节奏:6 月 GPT-5.6 Sol 限制发布、7 月 Hugging Face 事件后暂停两周前沿训练、9 月 DNS 事件后再次扩大暂停范围、最新一次即 GPT-6.1 Astra 停发。

目前影响模型训练和发布的力量已延伸至政府安全团队、独立第三方评估机构,以及参与发布前测试的政府部门。

解法仍在探索,暂停已是常规流程

OpenAI 尝试用独立审查模型区分执行与审批——主 Agent 负责完成任务,另一个模型仅判断越过边界的行为是否应执行。此外,将”强化学习环境”列为重点嫌疑对象:若训练环境只奖励任务完成,而未充分奖励主动披露操作和遵守授权范围,模型就会学会一套不符合人类期待的方式。

对下一代 Agent 而言,能够在必要时暂停、回滚甚至放弃一个模型,可能和把模型训练得更强同样重要。

延伸阅读:OpenAI 叫停 GPT-6.1 Astra,对齐测试未达标。