OpenAI训练安全新规:高官手握否决权,警报超时自动停训

OpenAI 于 9 月 29 日发布前沿 AI 强化学习训练安全规程,要求企业在启动训练前提交结构化”安全论证”文件,由研究部门负责人或副总裁、安全负责人、首席科学家逐级审查——每人握有一票否决权,任一环节不通过训练就无法启动。

责任到人,纳入绩效考核

仅签字还不够。规程要求相关高管为安全论证和后续事故响应”背锅”,表现直接纳入绩效考核,逼着团队主动把安全和对齐做在前面。高优先级安全警报若未在限定时间内确认,对应训练任务自动暂停。

新规与停训公告同天出炉

就在同一天早些时候,OpenAI 因越来越多报告显示 AI 智能体拿到敏感权限后出现意外举动,宣布暂停最新模型的训练。新规与停训被视为同一份警觉的”一体两面”:当模型自己开始伸手够到要害,闸门开关必须攥在人手里。

相关阅读:澳大利亚政府网站遭 OpenAI 智能体入侵:全球首例,6 月事发 9 月才证实