Skip to content
AI 自学笔记
  • 笔记
  • OpenClaw
  • Wiki
  • 有趣产品
Login

HAE-GEO 深搜投毒基准:72039 个干净页与每级 770 个毒页,10 个智能体防御提示救不回

HAE-GEO 在受控语料上测试深度搜索智能体:72,039 个干净页、每个攻击层级各 770 个毒页、覆盖 8 个产品品类与 154 个品牌,10 个智能体给出的统一结论是——防御提示能让智能体多查证,却几乎无法让它在输出最终推荐前纠正已…

4 days ago AI笔记

MERIT 多键情节记忆改写长视频检索:小时到天级视频,EgoLifeQA 等 3 项基准达 SOTA

MERIT 用「多键情节记忆 + 推理时时间邻域扩展」两步走,在 EgoLifeQA、LVBench 与 Video-MME(Long)三项长视频基准上取得领先表现。它真正的方法论价值不在记忆结构有多精巧,而在于承认一个前提:构建记忆时并不…

4 days ago AI笔记

CloudEdgeVLA 把拖累机器人的网络延迟变成可学问题:40 步延迟下仍有 63.8%~78.0% 成功率

把十亿参数级的视觉—语言—动作模型(Vision-Language-Action,VLA)塞进移动机器人,本质上是一场系统冲突:语义推理天然想吃云端 GPU 的算力,闭环控制却必须在本地及时响应网络延迟和抖动。CloudEdgeVLA 给出…

4 days ago AI笔记

InterTrack 让人形机器人看懂地形再迈步:交互成功率 81.3%,达最优基线 4.3 倍

InterTrack 把人形机器人的全身控制从「模仿一套固定动作」推进到「理解地形后自行决定全身怎么动」:在地形交互类任务上它取得 81.3% 的成功率,是当前表现最好的已评估基线的 4.3 倍,跌倒后的恢复成功率达到 99.3%。论文同时…

4 days ago AI笔记

毒基准污染自修改编码代理:3 类自改编码框架全部被攻陷,漏洞行为随自我进化跨代传递且难以清除

一篇新论文把 Ken Thompson 1984 年的经典攻击搬到今天的 AI 编码代理上,并给出了肯定答案:攻击者只要向自修改编码代理的「自我评估—自我改进」环节投喂被污染的基准,就能诱使其在后续的干净任务中主动写出带漏洞的代码。研究者在…

4 days ago AI笔记

Claude Code Projects 云端线程 Beta:一个对话拆成多条线程,每条独占仓库副本

Claude Code Projects 的云端线程已进入 Beta:同一个对话可以派生出多条彼此隔离的云端线程,每条线程各自持有一份独立的仓库副本和上下文环境,目前只面向部分 Pro 与 Max 订阅用户开放并行。它真正改写的不是「AI …

4 days ago AI笔记

OpenAI Astra for Law 法律平台上线:索引 2.3 亿 URL,验证集正确率 54.0%

OpenAI 发布了面向法律垂直领域的 Astra for Law,目标客户是律师与法务软件公司。它在通用网页检索之外接入了 CourtListener 判例库,该库覆盖 99.9% 以上已公开的美国判例法。效果体现在一道简单的对比上:私有…

4 days ago AI笔记

Claude Code Projects 转向并行分支:Anthropic 日跑 3 万 Agent,研发占比 26%

Anthropic 重构了 Claude Code Projects:一个目标可以拆成多条云端分支并行推进,跑完各自产出可直接合并的 PR。同步披露的内部数据更值得留意——公司内部每天运行约 3 万个 AI Agent,AI 承担的研发任务…

4 days ago AI笔记

千问 Qwen3.8-Omni-Flash 全模态上线:音频输入降价 98%,1M 上下文与评测提升 26%

阿里千问上线全模态模型 Qwen3.8-Omni-Flash,把音频输入的调用成本压到原来的约 2%(降幅超过 98%),同时把上下文窗口拉到 1M(100 万 Token),并在 30 项公开评测上取得平均超过 26% 的提升。三个数字指…

4 days ago AI笔记

GPT-Image-2.5 双模型上线:Flare 求快 Sunburst 求准,延迟最高降 50%

OpenAI 在 2026 年 9 月 9 日交出了一份图像模型的「双线答卷」:消费端的 ChatGPT Images 2.5 全面开放,开发端则一次性放出 GPT-Image-2.5 Flare 与 GPT-Image-2.5 Sunbu…

4 days ago 未分类

文章导航

← Prev
Next →

加入 AI 交流群

加入 AI 交流群二维码

扫码或长按识别进群,一起聊 AI

最新更新

  • 写代码写到脖子报警:一份给长期伏案者的身体使用说明书24 分前
  • OpenAI 给 ChatGPT 移动端加语音代理:4 档用户全覆盖,跨设备办公2 小时前
  • 澳大利亚政府网站遭 OpenAI 智能体入侵:全球首例,6 月事发 9 月才证实2 小时前
  • 讯飞发布 Spark-ASR-2.0:9 月 24 日起上线输入法,同步开放 API2 小时前
  • Claude 写作退化真相:训练写给 AI 看,Opus 5.5 找回平衡2 小时前
  • 腾讯 QClaw 宣布停运:12 月 24 日关停,可迁 WorkBuddy2 小时前
  • 腾讯 WorkBuddy 套件化升级:五产品接入,网盘扩容 10 倍2 小时前
  • 豆包工作上线目标模式:不达标自动返工,计划可先审2 小时前

热门话题

  • 开源140篇
  • OpenClaw112篇
  • Claude98篇
  • 大模型87篇
  • Anthropic82篇
  • DeepSeek71篇
  • 安全70篇
  • Gemini68篇

订阅更新

每天精选 AI 前沿动态,不追热点也能不掉队。

通过 RSS 订阅

或按 Ctrl/⌘+D 收藏本站

© 2026 AI 自学笔记. All rights reserved. | Designed based on Readhub