AI benchmarks 2026:MMLU 退役,ARC-AGI-3 接棒

翻 2026 年的模型发布会,你会看到一个规律,厂商报分的清单一直在换。三年前人手一个 MMLU,现在主流发布页上它几乎绝迹。原因不复杂,前沿模型在 MMLU 上全部冲到 92% 以上,HumanEval 也早就被打穿,这两位老将已经分不出…

4 days ago AI笔记

机器学习能识别鸟鸣地域方言,通用大模型却常认错

鸟鸣也有方言。锤头鹀在不同地区的鸣声存在差异,而这种差异是可以被模型稳定利用的信号。 研究是怎么做的 研究者的做法分两步。先用鸟类鸣声分类器提取 embeddings,再在这层之上训练一个细分类模型,把锤头鹀的方言差异专门当成一个难任务来处…

6 days ago AI笔记

Anthropic 五年投 10 亿美元做外部安全评估

Anthropic 把外部评估的活交给了埃森哲。埃森哲的 Faculty 团队会进场做模型评测、红队测试、对齐评估与防护测试,双方计划五年各投入至少 10 亿美元建设 AI 安全能力。 争议点在钱从哪来 评估费用由 Anthropic 自己…

6 days ago AI笔记