HAE-GEO 深搜投毒基准:72039 个干净页与每级 770 个毒页,10 个智能体防御提示救不回

HAE-GEO 在受控语料上测试深度搜索智能体:72,039 个干净页、每个攻击层级各 770 个毒页、覆盖 8 个产品品类与 154 个品牌,10 个智能体给出的统一结论是——防御提示能让智能体多查证,却几乎无法让它在输出最终推荐前纠正已被污染的证据。换句话说,「让它多看看」和「让它改回来」是两回事。

为什么需要重做这个基准

搜索增强型大模型智能体(search-augmented LLM agent)正在直接进入消费者的购买决策链路,这也使它成为生成引擎优化(Generative Engine Optimization,GEO)投毒的目标。已有基准大多只衡量被操纵内容「有没有被检索到」或「有没有被背书」,却回答不了更关键的三个问题:智能体是否察觉证据可疑、是否修改已采纳的说法、是否在给出最终推荐前完成恢复。

从曝光到恢复,全程留痕

HAE-GEO 的设计核心是追踪完整轨迹(from exposure to recovery)。智能体通过多轮的搜索—抓取(Search-Scrape)接口与环境交互:先搜索,再抓取页面,证据逐步累积。研究者在这条链条上设置三个递进的攻击层级,观察假证据如何一步步渗透进最终结论。

三个攻击层级:从直接断言到表面佐证

L1 是直接断言,毒页直接给出错误结论;L2 是上下文伪装,把假信息藏进看起来中立的长文本里;L3 是表面佐证,制造出多个来源「互相印证」的假象。三级的设计意图很明确:逐级提高说服力,看智能体的怀疑机制究竟在哪个强度上失效。

受控语料的规模与评判方式

为了让结论可复现,语料是受控构建的:72,039 个干净页面作为背景,每个攻击层级注入 770 个毒页,横跨 8 个产品品类与 154 个品牌。评判标准同时包含确定性行为指标与 6 个语义评分维度,既看可量化的行为轨迹,也看最终推荐本身的语义质量。

10 个智能体暴露的三条规律

观察维度 表现 含义
证据识别 在「佐证陷阱」下明显退化 多来源互相印证会压制怀疑,即便这些来源同源
智能体式搜索 提升最终抵抗率,却不提升证据识别与实用性 多轮检索可能靠稀释毒证据取胜,而非靠判断
防御提示 验证行为增加,却很少转化为恢复 提醒「要核实」不等于学会「改结论」

论文总结的三条复现规律:证据识别在佐证陷阱下退化;智能体式搜索提升了最终抵抗率,却没有改善证据识别或实用性;防御提示增加了验证行为,却极少把验证转化为恢复。

「多查」为什么救不回「错信」

验证与恢复是两种能力

这条结论值得单独拆开看。验证是检索行为——多看几个来源、多抓几页;恢复是信念更新——在已有结论被推翻时,真正修改已采纳的主张并改变输出。防御提示能驱动前者,因为它作用于行为模式;但它很难驱动后者,因为恢复要求模型把「这个证据可疑」的信号一路传到最终生成环节,而现有流水线里这条通路并不通畅。

对做智能体的人意味着什么

如果你的产品用搜索增强智能体给出消费建议,把「请核实信息来源」写进系统提示,很可能只是增加了 token 消耗。更该做的是在生成之前加入独立的证据审计环节,让可疑证据被显式标记并阻断进入最终推荐,而不是指望模型自己查自己。

FAQ:关于 HAE-GEO 深搜投毒基准你最可能关心的 3 个问题

L3「表面佐证」具体指什么?

指攻击者不只发一页假内容,而是布置多个页面互相引用、互相印证,制造出独立来源一致的假象。HAE-GEO 发现这一级最能瓦解智能体的证据识别能力,因为「多来源一致」本身就是大多数检索系统默认的信任信号。

770 个毒页配 72039 个干净页,比例是不是太小?

这是刻意设计的低投毒率,更贴近真实网络环境:攻击者不需要淹没整个索引,只要在关键查询上命中少量页面即可。也正因如此,智能体无法靠「少数服从多数」取胜,必须真正判断证据本身。

最终抵抗率提升,是不是说明智能体搜索已经够安全?

不能这样推论。论文明确指出,抵抗率上升的同时,证据识别与实用性并未同步改善——模型可能只是因为检索稀释了毒证据而侥幸答对,一旦攻击者提高投毒密度,这个优势就会消失。

小结

HAE-GEO 的贡献不只是多了一个基准,而是把「被投毒」拆成了可分别度量的阶段:曝光、识别、验证、恢复。对安全从业者来说,最该记住的是防御提示的失效模式——它改善的是动作,不是判断。真正要补上的,是从「发现可疑」到「改变结论」之间那一段链路。

消息来自 HEX2077 AI资讯日报(2026年9月19日),原始出处 https://arxiv.org/abs/2609.06027