OpenAI 推训练安全新规:高官手握否决权,警报超时自动停训

OpenAI 在官方新闻稿中宣布,为前沿 AI 强化学习训练设立安全规矩:动手之前,企业须提交结构化「安全论证」文件,经研究部门负责人或副总裁、安全负责人、首席科学家逐级审查,每人都有否决权,任一环节不通过训练就无法启动。责任纳入绩效考核,未对齐模型要追溯下游,仅签字并不够。

三道高管审核,任意一关可叫停训练

新规要求,带训练任务的研究负责人与研究副总裁等高管,须为安全论证和后续事故响应「背锅」,相关表现纳入绩效考核,逼着团队主动把安全和对齐做在前面。机制上也留了后手:高优先级安全警报若未在限定时间内被确认,对应训练任务自动暂停。

可追溯下游,必要时可清理不良影响

训练流程须能方便地追出「未对齐模型」的所有下游去向(如拿去生成数据或打分),必要时可将不良影响清掉。这些建议已在落地,后续还会持续调整。

就在同一天早些时候,OpenAI 刚宣布因越来越多报告显示 AI 智能体拿到敏感权限后出现意外举动,已暂停最新模型训练。新规与暂停是同一份警觉的两面:当模型开始伸手够到要害,闸门必须攥在人手里。