Deep Noir 把激活转向(activation steering)的调参过程自动化:用 Logit Lens 收敛与因果头级归因自动找出该在网络的哪一层、哪几个注意力头上施加转向,以及强度取多大。论文报告在 7–9B 规模的四个架构上,垃圾内容分类任务提升达 21 至 42 个百分点;同时给出一个必须正视的代价——转向强度越大,提示注入的攻击面越可预测。
激活转向为什么卡在「手工试错」
激活转向是在推理时直接修改模型的中间激活来改变其行为,无需微调权重。它便宜、可逆、即插即用,但实用化一直卡在一个瓶颈上:转向向量插在哪一层、选哪些注意力头、系数取多大,基本靠人手动搜索。模型规模越大,搜索空间越不可枚举,于是很多团队干脆放弃,或者沿用一组在别的模型上试出来的经验值。
两个必须先回答的问题
要把这件事自动化,得先回答两个问题:一是「哪里有效」——模型内部究竟在哪一层把某个语义概念算清楚了;二是「强度多少」——在不破坏整体语言能力的前提下能推多远。Deep Noir 分别用 Logit Lens 收敛和因果头级归因来回答这两问。
Deep Noir 的两件工具
Logit Lens 收敛定位层
Logit Lens 的做法是把中间层的隐藏状态直接投影到词表上,看模型「此刻最想输出什么」。Deep Noir 观察这一投影随层数推进的收敛过程:当某一层的投影结果开始稳定地指向目标概念时,就说明语义在此处已经成形,是合适的干预点。这样就不需要逐层试插向量。
因果头级归因定位头与强度
知道层还不够,同一层里还有多个注意力头。Deep Noir 用因果归因(causal head-level attribution)逐个头地评估「屏蔽它会不会掉点」,把贡献量化出来,再由引擎自动组合出转向参数。作者把这套方法称为架构计时法(Architectural Chronometry):把语义成形的时间点当作可测量的坐标。
实测结果:跨规模、跨架构
| 规模 | 模型数 | 任务 | 结果 |
|---|---|---|---|
| 1B | 3 | 垃圾内容分类 | 平均提升 16.7 个百分点,标准差 4.7(39 次运行) |
| 2–3B | 2 | 跨任务迁移 | 干预点可复用,无需重新搜索 |
| 7–9B | 4 | 垃圾内容分类 | 提升 21 至 42 个百分点 |
| 多规模 | — | SST-2 情感分类 | 提升 13.1 个百分点,零代码改动 |
论文给出的对照结果:在情感任务上,不做头部屏蔽的 RepE 相对基线没有提升,而 Deep Noir 在所有模型上均有改善,显著性 p 小于 0.01。
为什么「零代码改动」值得强调
SST-2 上 13.1 个百分点的提升,是在不改动任务代码的前提下取得的。这意味着同一套自动发现流程可以直接套到新任务上,而不必为每个任务重写注入逻辑。对工程团队来说,这才是从「研究技巧」变成「可用工具」的分界线。
代价:转向越强,越容易被注入
一个可预测的攻击面
论文同时报告:转向会制造出一个可预测的提示注入攻击面,而且脆弱性随转向强度单调上升。直觉上的解释是,转向相当于在模型内部打通了一条稳定的行为通道,攻击者只要找到与之共振的输入模式,就能以较小的代价撬动输出。
给部署方的建议
这直接关系到把转向后模型当分类器用的智能体系统。建议把转向强度当作安全参数而不是纯性能参数来调:在达到任务指标的前提下取最小可行强度,并对转向后的模型单独做提示注入红队测试,不要沿用原模型的安全结论。
FAQ:关于 Deep Noir 激活转向你最可能关心的 3 个问题
Logit Lens 收敛到底在测什么?
测的是「语义在第几层定型」。把每一层的隐藏状态投影到词表,观察目标概念何时开始稳定出现;收敛越早,说明概念成形越早,干预点就可以选在那里,避免在不相关的浅层做无效干预。
42 个百分点是不是所有模型都能拿到?
不是。42 是 7–9B 区间四个架构上的上限值,该区间的整体提升区间是 21 至 42 个百分点;1B 规模的平均提升是 16.7 个百分点,标准差达 4.7,说明单次运行波动不小,不应按最优值做容量规划。
转向能替代微调吗?
在轻量行为修正上可以替代,比如让模型更保守地判定垃圾内容、更稳定地输出情感倾向。但它改变的是推理时的激活,不等于把知识写进权重;若任务需要新的领域知识,微调或检索增强仍是更合适的选择。
小结
Deep Noir 的意义在于把激活转向从一门手艺变成了一个可搜索的参数空间:先测语义在哪层成形,再用因果归因挑头定强度。同样需要记住的是它的另一半结论——性能增益与安全脆弱性沿着同一个旋钮同步上升。任何把转向后模型放进生产链路的团队,都必须把强度纳入威胁模型,而不只是准确率曲线。
消息来自 HEX2077 AI资讯日报(2026年9月19日),原始出处 https://arxiv.org/abs/2609.20722
相关阅读
这条线上还有几篇站内文章可以接着看:
- agentic-eCAL 实测多智能体能耗:跨 5G 与光链路的文本传输仅占 0.25%,成本在 GPU 推理
- HAE-GEO 深搜投毒基准:72039 个干净页与每级 770 个毒页,10 个智能体防御提示救不回
- MERIT 多键情节记忆改写长视频检索:小时到天级视频,EgoLifeQA 等 3 项基准达 SOTA
延伸阅读
- DeepSeek Harness 插件安装教程,一条 dsh plugin 命令给 AI 助手装上超能力1 月前
- Gemini 5 月安全测试闯入 3 家真实公司:谷歌延宕 7 周才确认,根因指向同一评估商2 天前
- Cloudflare安全审计技能走红:面向AI编码Agent,GitHub 5407 Stars5 天前
- 国际空间站将办 AI 机器人竞赛:日本 SAIRA 牵头,最早 2027 年用物理 AI 操控 Int-Ball21 天前
