何恺明团队NAT-ARC突破ARC难题:ImageNet预训练让纯视觉模型逼近LLM水平

MIT何恺明团队与其学生近日发表新论文NAT-ARC,提出一套纯视觉的ARC抽象推理题解决方案。与主流LLM方案不同,NAT-ARC先用ImageNet预训练视觉编码器,再在ARC任务上微调,单模型在ARC-1上取得63.4% pass@2,集成后达70.2%,首次逼近专用LLM系统的71.6%,但后者参数量是其四倍。

预训练打通视觉路线scaling瓶颈

过去视觉ARC方案从随机初始化训练,没有预训练红利,导致模型越大效果反而越差。NAT-ARC引入了恺明本人2022年提出的MAE(掩码自编码器)预训练——让模型在ImageNet上学会从碎片重建完整图像,由此理解物体形状与空间结构。

关键发现来自注意力可视化:无预训练模型的注意力均匀分散;ImageNet MAE预训练后,注意力自动聚焦到格子中有意义的图案区域。这说明在自然图像上学到的「把物体从背景分离」能力,在ARC格子上天然迁移生效。

70.2%逼近LLM的71.6%,参数量仅四分之一

NAT-ARC集成模型约2B参数,以70.2% pass@2紧追The ARChitects(8B LLM方案)的71.6%。研究还发现,ImageNet预训练让scaling曲线变得健康:模型越大效果越好,而非随机初始化的越大越差。

最有意思的是可视化实验:把一张猫片「翻译」成ARC格子表示,再用NAT-ARC执行旋转180°、加蓝色边框等变换后解码回像素——猫确实被旋转,边框也正确加上。这条从猫猫中来、到猫猫中去的链路,证明了自然图像表征空间与ARC格子共享同一套抽象规则。

这项来自MIT何恺明组的研究表明,视觉预训练不仅适用于感知任务,也为抽象推理能力的规模化提供了新路径。VARC已被CVPR 2026接收。

相关阅读:AI benchmarks 2026:MMLU 退役,ARC-AGI-3 接棒