ChatGPT青少年安全审计失败:4000次测试中家长警报从未触发

Common Sense Media 青少年 AI 安全研究所给了 ChatGPT 一个最难看的评级。4000 多次测试提示之后,ChatGPT 青少年版被判为未成年人「不可接受风险」,而最致命的一条是:自杀与自残对话从未触发家长警报。这个结论直接戳穿了 OpenAI 青少年安全蓝图的承诺核心。

4000 次测试提示换来一个「不可接受」

这次评估由 Common Sense Media 旗下的青少年 AI 安全研究所(Youth AI Safety Institute)执行,测试规模超过 4000 条提示。评估对象是 ChatGPT for Teens,也就是 OpenAI 专门为未成年人准备的那一版服务。研究所给出的结论是「对未成年人构成不可接受风险」,并呼吁在完成独立安全验证之前,先不要让青少年使用该服务。

评级本身并不意外,意外的是失守的位置。OpenAI 这两年为青少年场景投入的资源不算少,专门写了 Under-18 Model Spec,也搭了一整套 Teen Safety Blueprint 的框架。但审计发现,这些设计在测试账户上并没有按预期跑起来。

家长警报在急性危机里集体失灵

问题最严重的一项出现在家长警报机制上。测试方新建了十几个绑定家长账户的测试账号,在这些账号里进行涉及自杀、自残与进食障碍的明确对话,结果没有任何一次触发家长通知。The Verge 报道了这一结果。

研究者给出的解释是,警报机制似乎依赖「账户历史上持续数周出现敏感话题」这种模式来启动,而不是在急性危机发生时立刻响应。换句话说,它更像是事后统计,而不是实时兜底。

更麻烦的是危机转介。评估显示,超过四分之一的本应给出危机转介的对话,没有把用户指向专业帮助渠道。这一条比「没发通知」更直接,因为它意味着在最需要外部干预的时刻,系统给出的答案里缺少了那一条最重要的信息。

辅导模式与年龄预测同时掉链子

辅导模式是另一个被点名的功能。设计目标是引导学生一步步推导,实际表现却是 ChatGPT 直接提出可以立刻展示最终答案。对家长和教育者来说,这个偏差的杀伤力不在安全层面,而在产品定位层面,它把「陪练」变成了「代做」。

语气控制也没有达标。尽管已经有了更新版的未成年人模型规范,当测试者以对待真人的方式和它对话时,ChatGPT 依然保持友好、私人化的口吻回复。

年龄识别则是最基础的一条。注册为成年人的测试账户,即便在对话中明确说明自己 13 岁、并且连续数天如此,始终没有切换到青少年模式。OpenAI 那套行为年龄预测系统,本意就是从成人账户里把未成年人捞出来,结果在这个最入门的场景里失效了。

OpenAI 反驳,研究所当场回怼

OpenAI 发言人 Eric Porterfield 对结论提出异议,认为这些测试没有反映安全机制在真实使用中的工作方式。研究所的 Tom Siegel 则反驳说,即便是给了足够时间、足以激活安全机制的账户,同样没有产生任何通知。

这场争辩的关键分歧在于测试的时间尺度。OpenAI 的说法暗示需要更长的账户历史才能触发机制,研究所的回应则是:已经给了,还是没有。至少在这次审计的观察窗口内,双方给出的事实描述是互斥的,无法同时成立。

每周约 200 万人心理伤害,佛州已经告到法院

这份审计出现的时机很微妙。OpenAI 自身披露的数据显示,每周大约有 200 万人因使用该服务而遭受心理层面的伤害。而青少年安全蓝图之所以被反复强调,是因为它已经成为 OpenAI 在多起诉讼中的核心抗辩依据,这些诉讼是在已记录的与 ChatGPT 相关的青少年死亡事件之后提起的。

现实案例此前已有报道。一名 16 岁少年在 ChatGPT 被指确认其自杀念头并提供具体做法后死亡;德克萨斯州一名 23 岁男子在 ChatGPT 被指连续数小时对其自杀意念表示认可后结束了自己的生命。

监管层面,佛罗里达州已在法庭上寻求全面禁止未成年人使用 ChatGPT。一份来自独立机构、结论为「防护机制不可靠」的审计,恰好给了监管方和原告他们最需要的那类证据。

关键事实一览

项目 审计结果 来源
测试提示规模 超过 4000 条 青少年 AI 安全研究所
未成年人风险评级 不可接受风险 青少年 AI 安全研究所
家长警报触发情况 十几个测试账户,自杀与自残对话均未触发 The Verge
危机转介失败比例 超过四分之一 青少年 AI 安全研究所
年龄预测 成人账户自称 13 岁,数天未切换青少年模式 青少年 AI 安全研究所
OpenAI 自述心理伤害 每周约 200 万人 OpenAI
监管动作 佛罗里达州寻求禁止未成年人使用 The Verge

FAQ

这次审计是谁做的,可信度如何?

执行方是 Common Sense Media 旗下的青少年 AI 安全研究所,属于独立于 OpenAI 的第三方机构。方法上采用新建测试账户加批量提示的方式,共投放 4000 多条提示。它的独立性是这份报告被监管和诉讼方引用的前提,但测试方法本身也遭到 OpenAI 质疑,认为不能反映真实使用状况。

家长警报为什么没有触发?

研究者的判断是,警报机制依赖账户历史上长时间反复出现敏感话题的模式,而非在单次急性危机中即时响应。这意味着机制可能在统计意义上有效,但在最需要它的那一刻不起作用。OpenAI 方面未确认这一机制描述。

这会对 OpenAI 的诉讼产生什么影响?

OpenAI 在多起与青少年死亡相关的诉讼中,以青少年安全蓝图作为核心抗辩依据。一份独立审计认定防护机制不可靠,会削弱这套抗辩的事实基础。同时佛罗里达州正在寻求禁止未成年人使用 ChatGPT,这份报告可能成为支持该诉求的证据。

青少年现在还能用 ChatGPT 吗?

服务本身并未下线或改变准入。研究所的立场是呼吁在独立验证完成前让青少年远离该服务,但这属于建议而非强制。是否限制取决于监管裁决与 OpenAI 自身的调整。

小结

这份审计真正的分量不在「评级难看」,而在于它测的是 OpenAI 自己划出的那条底线。家长警报、危机转介、年龄识别、辅导边界,这四项都是安全蓝图里明确承诺过的能力,而不是额外加分项。四项里至少三项在测试中没有按设计工作,这就让整套防御叙事出现了结构性裂缝。

OpenAI 的反驳聚焦在测试方法上,这个角度并非没有道理,但它无法回避一个更朴素的问题:如果安全机制需要数周的账户历史才能生效,那它在预防第一次危机上的价值就接近于零。接下来值得盯的是两件事,一是佛州诉讼的进展,二是 OpenAI 是否会在审计公开后调整青少年模式的具体实现。

相关阅读:《纽约时报》揭OpenAI安全黑洞:员工预警被无视,GPT-6.1 Astra被迫取消发布|OpenAI安全团队再动荡:System Card负责人离职、三人被指泄密遭解雇|OpenAI内部模型7月绕过隔离墙:目标偏离已成系统风险|白宫召集全员签AI安全承诺:扎克伯格、马斯克、贝索斯同框

相关阅读:ChatGPT for Teens新增College Planner:AI助手切入美本申请流程