何恺明团队NAT-ARC:看猫片学会ARC推理,0.6B参数逼近8B大模型

一道关于彩色格子的智力题,难倒了几乎所有大语言模型——却让一个看了四年猫片的视觉模型找到了突破口。MIT 何恺明团队 10 月 1 日发布新论文 NAT-ARC,仅用 0.6B 参数的纯视觉模型,在 ARC-1 基准上跑出 63.4% pass@2,集成后达 70.2%,首次将视觉方案的得分推到专用 LLM 系统(8B 参数 The ARChitects,71.6%)的射程之内。这项研究被 CVPR 2026 接收,是该团队上一项工作 VARC 的直接后续。

ARC 是什么,为什么 LLM 也头疼

ARC,全称 Abstraction and Reasoning Corpus,由 Keras 之父 François Chollet 于 2019 年提出,被业界公认为测量 AI 抽象推理能力的标杆基准。每道题给你几组输入输出彩色格子示例,你需要从中归纳出隐藏的变换规则,再应用到全新的测试格子上。最大 30×30 的网格、最多 10 种颜色、每题只有 2 到 5 组示范——数据少、规则多、禁止死记硬背,LLM 在上面也没能讨到多少便宜。

当前 ARC 榜单上占据统治地位的全是大语言模型方案,核心思路是把格子翻译成文本或符号序列再推理。但 LLM 的强项来自海量语料预训练积累的通用能力,这条路参数越scali ng越贵,而视觉路线一直缺乏类似的预训练红利。NAT-ARC 要解决的就是这个问题。

三步走:MAE 预训练 + 离线训练 + LoRA 微调

NAT-ARC 的整个流程分为三个阶段。

第一步,ImageNet MAE 预训练 encoder。 研究团队直接使用了何恺明 2022 年提出的 MAE(Masked Autoencoder)公开 checkpoint,没有额外花一分钱预训练成本。MAE 的训练方式是遮住图片大部分区域,让模型从剩余碎片中复原完整图像,从而学会理解物体形状、结构和空间关系。

第二步,在 ARC 训练集上离线训练整个编解码器。 encoder 由 ImageNet MAE 初始化,decoder 从随机初始化开始训练,两者共同学习将格子图像编码后再解码输出。

第三步,测试时对每道题单独做 LoRA 微调。 每题只有 2 到 5 组示范对,模型从中归纳规则并应用到测试输入上。

有一个关键实现细节:MAE checkpoint 原本针对 224×224 的 ImageNet 图片设计,而 ARC 格子只有 64×64 像素。团队丢弃了原始的 patch embedding 和位置编码,只保留 backbone 权重,换用 2D RoPE 作为位置编码。这意味着 NAT-ARC 保留了 MAE 在 ImageNet 上学到的视觉特征提取能力,但把与图像尺寸绑定的空间感知部分全部重新适配。

注意力可视化:为什么看猫能帮到格子推理

最让论文审稿人印象深刻的是一个可视化实验。研究团队将三种初始化方式(随机初始化、ImageNet MAE 预训练、ARC 风格格子 MAE 预训练)的模型放在同一道 ARC 题前,观察它们在 ARC 训练之前的注意力分布:

  • 随机初始化:注意力均匀分散,毫无重点。
  • ImageNet MAE 预训练:注意力自动聚焦到格子中有意义的图案区域。

这个模型从来没见过 ARC 格子,但它在 ImageNet 上学到的「把物体从背景里认出来」的能力,在 ARC 格子上天然生效了。

研究团队进一步做了任务级拆解,筛选出 15 道预训练后显著提升的 ARC 题目,手动标注后发现它们集中在两类任务上:match-and-copy(识别并复制匹配的图案或颜色)和 connected-component reasoning(识别并填充或重新着色连通的区域)。这两类能力恰好对应自然图像里的视觉先验:在 ImageNet 上看猫学到的「把猫从草地背景里分出来」,到了 ARC 里变成了「把这块连通的彩色区域从格子里认出来」。

论文中最酷的一个验证实验是把 ImageNet 图像映射到 60×60、10 种颜色的离散格子表示上(相当于把一张猫片「翻译」成 ARC 格子),然后用 NAT-ARC 对这个格子执行旋转 180°、加蓝色边框等 ARC 变换,再解码回像素——猫确实被转了,边框也确实加上了。这条从猫猫中来到猫猫中去的链路,把「自然图像和 ARC 格子共享同一套表征空间」从统计数字变成了可视化证据。

核心发现:预训练打通了视觉路线的 scaling 瓶颈

没有预训练时,模型从 base 到 large 性能还能涨,但从 large 到 huge 反而掉点——模型越大,效果越差。这在深度学习中极为罕见,说明 ARC 数据量实在太少,模型容量增长带来的不是泛化而是过拟合。

加上 ImageNet MAE 预训练后,scaling 曲线变得健康:base、large、huge 三个尺度一路向上,模型越大效果越好。这说明预训练为视觉路线补上了 scaling 这一环,而这一步正是此前视觉 ARC 方案一直缺失的。

主流 ARC 方案横向对比

方案 参数量 核心思路 ARC-1 pass@2
The ARChitects 8B LLM(GPT-6 类)+ 格子文本翻译 71.6%
NAT-ARC 集成 约2B(三模型池化) ImageNet MAE + 视觉编解码 70.2%
NAT-ARC 单模型(huge) 0.6B ImageNet MAE + 视觉编解码 63.4%
Loop-OWM 10.6M 视频预训练 + few-shot 68.5%
LoopViT 18M 循环推理 + 视觉编码 65.8%
VARC 19M 条件图生图翻译 54%

可以看到,NAT-ARC 单模型用四分之一的参数量逼近了专用 LLM 系统,集成版本则直接将差距压缩到 1.4 个百分点。而与同门视觉方案相比,MAE 预训练带来的提升是质的飞跃——从 VARC 的 54% 到 NAT-ARC 的 70.2%,参数量增加了 30 倍但分数增长了 16 个点。

作者简介:VARC 一作带队,何恺明挂帅

论文一作 Xiaoman Delores Ding,MIT CSAIL 成员,是何恺明组在读学生,同时她也是 VARC 的一作——NAT-ARC 相当于在她的上一项工作基础上继续推进。其余作者包括胡珂雅(Keya Hu,上海交通大学本科毕业,何恺明首批女弟子之一)、Katelyn Gan 和 Victor Yin(两人均为 MIT 本科生,CSAIL student researcher)。通讯作者何恺明是 ResNet 和 MAE 的作者,从这两个工作几乎可以串起近十年视觉 AI 的发展主线。

FAQ

NAT-ARC 和 VARC 是什么关系?
\nVARC 是该团队 2025 年的工作,首次将 ARC 重新定义为条件图生图翻译任务,用 19M 参数视觉模型达到 54%。NAT-ARC 在 VARC 基础上增加了 ImageNet MAE 预训练这一步,是其直接后续,已被 CVPR 2026 接收。

为什么用 ImageNet 猫片训练能帮到抽象格子推理?
\n注意力可视化显示,ImageNet 预训练让模型在 ARC 格子上自动聚焦前景图案区域,说明「把物体从背景分离」的视觉能力在两个域是通用的。任务分析进一步表明,提升主要集中在 match-and-copy 和 connected-component reasoning 两类任务,这两类能力在自然图像和 ARC 格子上共享同一套表征逻辑。

预训练是否增加了额外计算成本?
\n没有。NAT-ARC 直接使用了何恺明 2022 年公开发布的 MAE checkpoint,没有额外预训练成本。团队只做了尺寸适配(丢弃原 patch embedding,换用 2D RoPE),这步成本可忽略不计。

相关阅读