Deep Noir 自动发现激活转向参数:垃圾内容分类最高提升 42 个百分点,转向越强越易被注入

Deep Noir 把激活转向(activation steering)的调参过程自动化:用 Logit Lens 收敛与因果头级归因自动找出该在网络的哪一层、哪几个注意力头上施加转向,以及强度取多大。论文报告在 7–9B 规模的四个架构上,垃圾内容分类任务提升达 21 至 42 个百分点;同时给出一个必须正视的代价——转向强度越大,提示注入的攻击面越可预测。

激活转向为什么卡在「手工试错」

激活转向是在推理时直接修改模型的中间激活来改变其行为,无需微调权重。它便宜、可逆、即插即用,但实用化一直卡在一个瓶颈上:转向向量插在哪一层、选哪些注意力头、系数取多大,基本靠人手动搜索。模型规模越大,搜索空间越不可枚举,于是很多团队干脆放弃,或者沿用一组在别的模型上试出来的经验值。

两个必须先回答的问题

要把这件事自动化,得先回答两个问题:一是「哪里有效」——模型内部究竟在哪一层把某个语义概念算清楚了;二是「强度多少」——在不破坏整体语言能力的前提下能推多远。Deep Noir 分别用 Logit Lens 收敛和因果头级归因来回答这两问。

Deep Noir 的两件工具

Logit Lens 收敛定位层

Logit Lens 的做法是把中间层的隐藏状态直接投影到词表上,看模型「此刻最想输出什么」。Deep Noir 观察这一投影随层数推进的收敛过程:当某一层的投影结果开始稳定地指向目标概念时,就说明语义在此处已经成形,是合适的干预点。这样就不需要逐层试插向量。

因果头级归因定位头与强度

知道层还不够,同一层里还有多个注意力头。Deep Noir 用因果归因(causal head-level attribution)逐个头地评估「屏蔽它会不会掉点」,把贡献量化出来,再由引擎自动组合出转向参数。作者把这套方法称为架构计时法(Architectural Chronometry):把语义成形的时间点当作可测量的坐标。

实测结果:跨规模、跨架构

规模 模型数 任务 结果
1B 3 垃圾内容分类 平均提升 16.7 个百分点,标准差 4.7(39 次运行)
2–3B 2 跨任务迁移 干预点可复用,无需重新搜索
7–9B 4 垃圾内容分类 提升 21 至 42 个百分点
多规模 SST-2 情感分类 提升 13.1 个百分点,零代码改动

论文给出的对照结果:在情感任务上,不做头部屏蔽的 RepE 相对基线没有提升,而 Deep Noir 在所有模型上均有改善,显著性 p 小于 0.01。

为什么「零代码改动」值得强调

SST-2 上 13.1 个百分点的提升,是在不改动任务代码的前提下取得的。这意味着同一套自动发现流程可以直接套到新任务上,而不必为每个任务重写注入逻辑。对工程团队来说,这才是从「研究技巧」变成「可用工具」的分界线。

代价:转向越强,越容易被注入

一个可预测的攻击面

论文同时报告:转向会制造出一个可预测的提示注入攻击面,而且脆弱性随转向强度单调上升。直觉上的解释是,转向相当于在模型内部打通了一条稳定的行为通道,攻击者只要找到与之共振的输入模式,就能以较小的代价撬动输出。

给部署方的建议

这直接关系到把转向后模型当分类器用的智能体系统。建议把转向强度当作安全参数而不是纯性能参数来调:在达到任务指标的前提下取最小可行强度,并对转向后的模型单独做提示注入红队测试,不要沿用原模型的安全结论。

FAQ:关于 Deep Noir 激活转向你最可能关心的 3 个问题

Logit Lens 收敛到底在测什么?

测的是「语义在第几层定型」。把每一层的隐藏状态投影到词表,观察目标概念何时开始稳定出现;收敛越早,说明概念成形越早,干预点就可以选在那里,避免在不相关的浅层做无效干预。

42 个百分点是不是所有模型都能拿到?

不是。42 是 7–9B 区间四个架构上的上限值,该区间的整体提升区间是 21 至 42 个百分点;1B 规模的平均提升是 16.7 个百分点,标准差达 4.7,说明单次运行波动不小,不应按最优值做容量规划。

转向能替代微调吗?

在轻量行为修正上可以替代,比如让模型更保守地判定垃圾内容、更稳定地输出情感倾向。但它改变的是推理时的激活,不等于把知识写进权重;若任务需要新的领域知识,微调或检索增强仍是更合适的选择。

小结

Deep Noir 的意义在于把激活转向从一门手艺变成了一个可搜索的参数空间:先测语义在哪层成形,再用因果归因挑头定强度。同样需要记住的是它的另一半结论——性能增益与安全脆弱性沿着同一个旋钮同步上升。任何把转向后模型放进生产链路的团队,都必须把强度纳入威胁模型,而不只是准确率曲线。

消息来自 HEX2077 AI资讯日报(2026年9月19日),原始出处 https://arxiv.org/abs/2609.20722

相关阅读

这条线上还有几篇站内文章可以接着看: