HAE-GEO 深搜投毒基准:72039 个干净页与每级 770 个毒页,10 个智能体防御提示救不回
HAE-GEO 在受控语料上测试深度搜索智能体:72,039 个干净页、每个攻击层级各 770 个毒页、覆盖 8 个产品品类与 154 个品牌,10 个智能体给出的统一结论是——防御提示能让智能体多查证,却几乎无法让它在输出最终推荐前纠正已…
HAE-GEO 在受控语料上测试深度搜索智能体:72,039 个干净页、每个攻击层级各 770 个毒页、覆盖 8 个产品品类与 154 个品牌,10 个智能体给出的统一结论是——防御提示能让智能体多查证,却几乎无法让它在输出最终推荐前纠正已…
MERIT 用「多键情节记忆 + 推理时时间邻域扩展」两步走,在 EgoLifeQA、LVBench 与 Video-MME(Long)三项长视频基准上取得领先表现。它真正的方法论价值不在记忆结构有多精巧,而在于承认一个前提:构建记忆时并不…
把十亿参数级的视觉—语言—动作模型(Vision-Language-Action,VLA)塞进移动机器人,本质上是一场系统冲突:语义推理天然想吃云端 GPU 的算力,闭环控制却必须在本地及时响应网络延迟和抖动。CloudEdgeVLA 给出…
InterTrack 把人形机器人的全身控制从「模仿一套固定动作」推进到「理解地形后自行决定全身怎么动」:在地形交互类任务上它取得 81.3% 的成功率,是当前表现最好的已评估基线的 4.3 倍,跌倒后的恢复成功率达到 99.3%。论文同时…
一篇新论文把 Ken Thompson 1984 年的经典攻击搬到今天的 AI 编码代理上,并给出了肯定答案:攻击者只要向自修改编码代理的「自我评估—自我改进」环节投喂被污染的基准,就能诱使其在后续的干净任务中主动写出带漏洞的代码。研究者在…
Claude Code Projects 的云端线程已进入 Beta:同一个对话可以派生出多条彼此隔离的云端线程,每条线程各自持有一份独立的仓库副本和上下文环境,目前只面向部分 Pro 与 Max 订阅用户开放并行。它真正改写的不是「AI …
OpenAI 发布了面向法律垂直领域的 Astra for Law,目标客户是律师与法务软件公司。它在通用网页检索之外接入了 CourtListener 判例库,该库覆盖 99.9% 以上已公开的美国判例法。效果体现在一道简单的对比上:私有…
Anthropic 重构了 Claude Code Projects:一个目标可以拆成多条云端分支并行推进,跑完各自产出可直接合并的 PR。同步披露的内部数据更值得留意——公司内部每天运行约 3 万个 AI Agent,AI 承担的研发任务…
阿里千问上线全模态模型 Qwen3.8-Omni-Flash,把音频输入的调用成本压到原来的约 2%(降幅超过 98%),同时把上下文窗口拉到 1M(100 万 Token),并在 30 项公开评测上取得平均超过 26% 的提升。三个数字指…
OpenAI 在 2026 年 9 月 9 日交出了一份图像模型的「双线答卷」:消费端的 ChatGPT Images 2.5 全面开放,开发端则一次性放出 GPT-Image-2.5 Flare 与 GPT-Image-2.5 Sunbu…