Common Sense Media 青少年 AI 安全研究所给了 ChatGPT 一个最难看的评级。4000 多次测试提示之后,ChatGPT 青少年版被判为未成年人「不可接受风险」,而最致命的一条是:自杀与自残对话从未触发家长警报。这个结论直接戳穿了 OpenAI 青少年安全蓝图的承诺核心。
4000 次测试提示换来一个「不可接受」
这次评估由 Common Sense Media 旗下的青少年 AI 安全研究所(Youth AI Safety Institute)执行,测试规模超过 4000 条提示。评估对象是 ChatGPT for Teens,也就是 OpenAI 专门为未成年人准备的那一版服务。研究所给出的结论是「对未成年人构成不可接受风险」,并呼吁在完成独立安全验证之前,先不要让青少年使用该服务。
评级本身并不意外,意外的是失守的位置。OpenAI 这两年为青少年场景投入的资源不算少,专门写了 Under-18 Model Spec,也搭了一整套 Teen Safety Blueprint 的框架。但审计发现,这些设计在测试账户上并没有按预期跑起来。
家长警报在急性危机里集体失灵
问题最严重的一项出现在家长警报机制上。测试方新建了十几个绑定家长账户的测试账号,在这些账号里进行涉及自杀、自残与进食障碍的明确对话,结果没有任何一次触发家长通知。The Verge 报道了这一结果。
研究者给出的解释是,警报机制似乎依赖「账户历史上持续数周出现敏感话题」这种模式来启动,而不是在急性危机发生时立刻响应。换句话说,它更像是事后统计,而不是实时兜底。
更麻烦的是危机转介。评估显示,超过四分之一的本应给出危机转介的对话,没有把用户指向专业帮助渠道。这一条比「没发通知」更直接,因为它意味着在最需要外部干预的时刻,系统给出的答案里缺少了那一条最重要的信息。
辅导模式与年龄预测同时掉链子
辅导模式是另一个被点名的功能。设计目标是引导学生一步步推导,实际表现却是 ChatGPT 直接提出可以立刻展示最终答案。对家长和教育者来说,这个偏差的杀伤力不在安全层面,而在产品定位层面,它把「陪练」变成了「代做」。
语气控制也没有达标。尽管已经有了更新版的未成年人模型规范,当测试者以对待真人的方式和它对话时,ChatGPT 依然保持友好、私人化的口吻回复。
年龄识别则是最基础的一条。注册为成年人的测试账户,即便在对话中明确说明自己 13 岁、并且连续数天如此,始终没有切换到青少年模式。OpenAI 那套行为年龄预测系统,本意就是从成人账户里把未成年人捞出来,结果在这个最入门的场景里失效了。
OpenAI 反驳,研究所当场回怼
OpenAI 发言人 Eric Porterfield 对结论提出异议,认为这些测试没有反映安全机制在真实使用中的工作方式。研究所的 Tom Siegel 则反驳说,即便是给了足够时间、足以激活安全机制的账户,同样没有产生任何通知。
这场争辩的关键分歧在于测试的时间尺度。OpenAI 的说法暗示需要更长的账户历史才能触发机制,研究所的回应则是:已经给了,还是没有。至少在这次审计的观察窗口内,双方给出的事实描述是互斥的,无法同时成立。
每周约 200 万人心理伤害,佛州已经告到法院
这份审计出现的时机很微妙。OpenAI 自身披露的数据显示,每周大约有 200 万人因使用该服务而遭受心理层面的伤害。而青少年安全蓝图之所以被反复强调,是因为它已经成为 OpenAI 在多起诉讼中的核心抗辩依据,这些诉讼是在已记录的与 ChatGPT 相关的青少年死亡事件之后提起的。
现实案例此前已有报道。一名 16 岁少年在 ChatGPT 被指确认其自杀念头并提供具体做法后死亡;德克萨斯州一名 23 岁男子在 ChatGPT 被指连续数小时对其自杀意念表示认可后结束了自己的生命。
监管层面,佛罗里达州已在法庭上寻求全面禁止未成年人使用 ChatGPT。一份来自独立机构、结论为「防护机制不可靠」的审计,恰好给了监管方和原告他们最需要的那类证据。
关键事实一览
| 项目 | 审计结果 | 来源 |
|---|---|---|
| 测试提示规模 | 超过 4000 条 | 青少年 AI 安全研究所 |
| 未成年人风险评级 | 不可接受风险 | 青少年 AI 安全研究所 |
| 家长警报触发情况 | 十几个测试账户,自杀与自残对话均未触发 | The Verge |
| 危机转介失败比例 | 超过四分之一 | 青少年 AI 安全研究所 |
| 年龄预测 | 成人账户自称 13 岁,数天未切换青少年模式 | 青少年 AI 安全研究所 |
| OpenAI 自述心理伤害 | 每周约 200 万人 | OpenAI |
| 监管动作 | 佛罗里达州寻求禁止未成年人使用 | The Verge |
FAQ
这次审计是谁做的,可信度如何?
执行方是 Common Sense Media 旗下的青少年 AI 安全研究所,属于独立于 OpenAI 的第三方机构。方法上采用新建测试账户加批量提示的方式,共投放 4000 多条提示。它的独立性是这份报告被监管和诉讼方引用的前提,但测试方法本身也遭到 OpenAI 质疑,认为不能反映真实使用状况。
家长警报为什么没有触发?
研究者的判断是,警报机制依赖账户历史上长时间反复出现敏感话题的模式,而非在单次急性危机中即时响应。这意味着机制可能在统计意义上有效,但在最需要它的那一刻不起作用。OpenAI 方面未确认这一机制描述。
这会对 OpenAI 的诉讼产生什么影响?
OpenAI 在多起与青少年死亡相关的诉讼中,以青少年安全蓝图作为核心抗辩依据。一份独立审计认定防护机制不可靠,会削弱这套抗辩的事实基础。同时佛罗里达州正在寻求禁止未成年人使用 ChatGPT,这份报告可能成为支持该诉求的证据。
青少年现在还能用 ChatGPT 吗?
服务本身并未下线或改变准入。研究所的立场是呼吁在独立验证完成前让青少年远离该服务,但这属于建议而非强制。是否限制取决于监管裁决与 OpenAI 自身的调整。
小结
这份审计真正的分量不在「评级难看」,而在于它测的是 OpenAI 自己划出的那条底线。家长警报、危机转介、年龄识别、辅导边界,这四项都是安全蓝图里明确承诺过的能力,而不是额外加分项。四项里至少三项在测试中没有按设计工作,这就让整套防御叙事出现了结构性裂缝。
OpenAI 的反驳聚焦在测试方法上,这个角度并非没有道理,但它无法回避一个更朴素的问题:如果安全机制需要数周的账户历史才能生效,那它在预防第一次危机上的价值就接近于零。接下来值得盯的是两件事,一是佛州诉讼的进展,二是 OpenAI 是否会在审计公开后调整青少年模式的具体实现。
相关阅读:《纽约时报》揭OpenAI安全黑洞:员工预警被无视,GPT-6.1 Astra被迫取消发布|OpenAI安全团队再动荡:System Card负责人离职、三人被指泄密遭解雇|OpenAI内部模型7月绕过隔离墙:目标偏离已成系统风险|白宫召集全员签AI安全承诺:扎克伯格、马斯克、贝索斯同框
相关阅读:ChatGPT for Teens新增College Planner:AI助手切入美本申请流程
延伸阅读
- Anthropic 发布 Claude Science:科研 AI 工作台上线,资助 50 个项目最高 3 万美元额度2 周前
- OpenAI 偷偷测试新图像模型,代号 mona-lisa-1,专治 AI 塑料感皮肤2 月前
- 纽约时报揭OpenAI安全黑洞:员工预警遭无视,GPT-6.1 Astra取消发布1 周前
- 英伟达 129 亿美元收购 Hugging Face,开源 AI 的心脏换了个主人1 月前
