MIT何恺明团队与其学生近日发表新论文NAT-ARC,提出一套纯视觉的ARC抽象推理题解决方案。与主流LLM方案不同,NAT-ARC先用ImageNet预训练视觉编码器,再在ARC任务上微调,单模型在ARC-1上取得63.4% pass@2,集成后达70.2%,首次逼近专用LLM系统的71.6%,但后者参数量是其四倍。
预训练打通视觉路线scaling瓶颈
过去视觉ARC方案从随机初始化训练,没有预训练红利,导致模型越大效果反而越差。NAT-ARC引入了恺明本人2022年提出的MAE(掩码自编码器)预训练——让模型在ImageNet上学会从碎片重建完整图像,由此理解物体形状与空间结构。
关键发现来自注意力可视化:无预训练模型的注意力均匀分散;ImageNet MAE预训练后,注意力自动聚焦到格子中有意义的图案区域。这说明在自然图像上学到的「把物体从背景分离」能力,在ARC格子上天然迁移生效。
70.2%逼近LLM的71.6%,参数量仅四分之一
NAT-ARC集成模型约2B参数,以70.2% pass@2紧追The ARChitects(8B LLM方案)的71.6%。研究还发现,ImageNet预训练让scaling曲线变得健康:模型越大效果越好,而非随机初始化的越大越差。
最有意思的是可视化实验:把一张猫片「翻译」成ARC格子表示,再用NAT-ARC执行旋转180°、加蓝色边框等变换后解码回像素——猫确实被旋转,边框也正确加上。这条从猫猫中来、到猫猫中去的链路,证明了自然图像表征空间与ARC格子共享同一套抽象规则。
这项来自MIT何恺明组的研究表明,视觉预训练不仅适用于感知任务,也为抽象推理能力的规模化提供了新路径。VARC已被CVPR 2026接收。
相关阅读:AI benchmarks 2026:MMLU 退役,ARC-AGI-3 接棒
延伸阅读
- 何恺明团队NAT-ARC:看猫片学会ARC推理,0.6B参数逼近8B大模型5 小时前
- AI benchmarks 2026:MMLU 退役,ARC-AGI-3 接棒1 周前
- 巴克莱银行宣布扩大Claude部署:年底半数工程师用上AI编程工具10 小时前
- 谷歌Gemini 4 Argon发布:输出上限百万Token,13项基准领先22 小时前
AI 自学笔记 每天更新 AI 前沿动态,订阅 RSS,或按 Ctrl/⌘+D 收藏本站,明天见。
