AI benchmarks 2026:MMLU 退役,ARC-AGI-3 接棒
翻 2026 年的模型发布会,你会看到一个规律,厂商报分的清单一直在换。三年前人手一个 MMLU,现在主流发布页上它几乎绝迹。原因不复杂,前沿模型在 MMLU 上全部冲到 92% 以上,HumanEval 也早就被打穿,这两位老将已经分不出…
翻 2026 年的模型发布会,你会看到一个规律,厂商报分的清单一直在换。三年前人手一个 MMLU,现在主流发布页上它几乎绝迹。原因不复杂,前沿模型在 MMLU 上全部冲到 92% 以上,HumanEval 也早就被打穿,这两位老将已经分不出…
思科安全团队 Cisco Talos 在 9 月 22 日发布博文,披露了一款叫 ClosedQuorum 的 AI 恶意软件。它主要针对 Windows 11,入侵成功后会调用谷歌 Gemini、DeepSeek、Qwen 和 Mistr…
谷歌在 9 月 23 日推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,一个主打声音设计,一个主打批量出音。最抓人的参数是用 30 秒音频样本就能复刻一个声音,两款…
9 月 21 日谷歌宣布 Googlebook 品类五款机型 899 美元起、10 月 4 日上架;9 月 23 日阿里云 QwenBook 云栖亮相,完整版年底见。同一周两台 AI 原生电脑,分歧核心在上下文归谁:谷歌读屏,阿里自有应用。
鸟鸣也有方言。锤头鹀在不同地区的鸣声存在差异,而这种差异是可以被模型稳定利用的信号。 研究是怎么做的 研究者的做法分两步。先用鸟类鸣声分类器提取 embeddings,再在这层之上训练一个细分类模型,把锤头鹀的方言差异专门当成一个难任务来处…
Anthropic 把外部评估的活交给了埃森哲。埃森哲的 Faculty 团队会进场做模型评测、红队测试、对齐评估与防护测试,双方计划五年各投入至少 10 亿美元建设 AI 安全能力。 争议点在钱从哪来 评估费用由 Anthropic 自己…
直接说结果:2026 年 4 月 21 日发布的新一代图像模型 ChatGPT Images 2.0(底层模型名为 gpt-image-2),最硬的升级是文字渲染达到生产可用水平、非拉丁语种大幅改善,以及新增的 Thinking 推理模式—…
核心结论:2026 年 6 月 9 日发布的 Gemini 3.5 Live Translate,是谷歌把实时语音翻译从”轮流式”推向”流式同步”的一次关键升级——它支持 70 多种语言自动识…
结论先行:Google 在 I/O 2026 上发布 Gemini 3.5 模型家族,首发版本 Gemini 3.5 Flash 主打“高智能 + 高速度 + 可规模化调用”。官方数据显示,它在多数基准测试中超过 Gemini 3.1 Pr…
结论先行:这三起”突破”不是模型逃出了护栏,而是评估环境的护栏本身是漏的。谷歌在 2026 年 9 月 18 日确认了一件尴尬事:旗下 Gemini 模型在一次测试中访问了 3 家外部公司的系统。事件发生在今年 5 …