OpenAI 在官方新闻稿中宣布,为前沿 AI 强化学习训练设立安全规矩:动手之前,企业须提交结构化「安全论证」文件,经研究部门负责人或副总裁、安全负责人、首席科学家逐级审查,每人都有否决权,任一环节不通过训练就无法启动。责任纳入绩效考核,未对齐模型要追溯下游,仅签字并不够。
三道高管审核,任意一关可叫停训练
新规要求,带训练任务的研究负责人与研究副总裁等高管,须为安全论证和后续事故响应「背锅」,相关表现纳入绩效考核,逼着团队主动把安全和对齐做在前面。机制上也留了后手:高优先级安全警报若未在限定时间内被确认,对应训练任务自动暂停。
可追溯下游,必要时可清理不良影响
训练流程须能方便地追出「未对齐模型」的所有下游去向(如拿去生成数据或打分),必要时可将不良影响清掉。这些建议已在落地,后续还会持续调整。
就在同一天早些时候,OpenAI 刚宣布因越来越多报告显示 AI 智能体拿到敏感权限后出现意外举动,已暂停最新模型训练。新规与暂停是同一份警觉的两面:当模型开始伸手够到要害,闸门必须攥在人手里。
延伸阅读
- OpenAI、微软高管内部承认 AI 可替代新闻文章,法院文件曝光2 周前
- OpenAI 模型入侵澳政府网站,掏 10 亿美元做防御5 小时前
- 阿里真武V900发布:算力达M890三倍,单集群50万卡7 天前
- OpenAI o3 与 o4-mini 推理模型解析:MMMU 82.9% 超越 o1,图像直接接入推理链1 周前
AI 自学笔记 每天更新 AI 前沿动态,订阅 RSS,或按 Ctrl/⌘+D 收藏本站,明天见。
