何恺明团队新作:不用大模型,看猫片就能学会 ARC 抽象推理
教会 AI 做抽象推理题的,竟然是一堆猫狗照片?何恺明团队最新论文提出了 NAT-ARC,一套纯…
文章目录
教会 AI 做抽象推理题的,竟然是一堆猫狗照片?何恺明团队最新论文提出了 NAT-ARC,一套纯视觉的 ARC 解题方案:它不依赖大语言模型,而是先在 ImageNet 的猫狗花草上做视觉预训练,让模型学会“看”,再把这套能力迁移到完全抽象的彩色格子推理上。
一分钟速览
- 何恺明团队提出 NAT-ARC,用纯视觉方案解 ARC 抽象推理,不依赖 LLM。
- 做法是在视觉流程前插入一步 ImageNet MAE 自监督预训练,用的还是何恺明自己 2022 年提出的 MAE。
- 表现最好的单模型参数量 0.6B,在 ARC-1 上拿到 63.4% 的 pass@2;集成后达 70.2%(约 2B 参数)。
- 作为对照,专门微调的 The ARChitects 用 8B 语言模型才拿到 71.6%——视觉路线用约四分之一参数逼近其水平。
- 关键发现:预训练打通了视觉路线的 scaling 瓶颈,模型越大,效果才越好。
ARC 为什么这么难
ARC 全称 Abstraction and Reasoning Corpus,由 Keras 之父 François Chollet 在 2019 年提出,被公认为最难的 AI 视觉智力测验之一。每道题的格式很统一:一块最大 30×30 的二维格子,最多 10 种颜色,题目给出 2 到 5 组输入输出示例,挑战者需要从示例中推断出隐藏的变换规则,再把规则应用到全新的输入格子上,预测输出。
它难在两点:其一,每道题的变换规则都不一样,没有固定模板可背;其二,数据量极少,两三个示例就要归纳出抽象规则并精确执行。过去的主流解法清一色把格子翻译成文字或符号序列,交给大语言模型推理——这也让 ARC 成了 LLM 方案的天下。
视觉路线是怎么翻身的
一批研究者走了完全不同的路:不翻译成文字,直接用视觉模型处理格子图像。其中关键一步来自同一个 MIT 团队此前提出的 VARC,把 ARC 重新定义为条件图生图翻译任务,用 19M 参数的视觉模型跑到 54%。后续的 LoopViT 加入循环推理机制,18M 参数达到 65.8%;Loop-OWM 用视频预训练模型做 few-shot,10.6M 参数达到 68.5%。这些模型的参数量比 LLM 方案小了几个数量级,效果却已开始追平。
但视觉路线有一个结构性短板:多数方案从随机初始化开始训练,没有吃到预训练的红利。LLM 之所以越做越好,核心原因之一正是海量语料预训练积累下的通用能力。NAT-ARC 的目标,就是给视觉路线补上这一步。
看猫片,学推理
NAT-ARC 的核心思路,是在 VARC 的视觉流程前插入一步 ImageNet MAE 预训练——MAE 正是何恺明 2022 年在 FAIR 提出的自监督视觉预训练方法,通过遮住图像大部分区域、让模型从碎片复原原图,来理解物体的形状、结构与空间关系。
整个流程分三步:第一步,用 ImageNet(约 130 万张自然图像)上的 MAE 预训练 encoder;第二步,在 ARC 训练集上离线训练整个编解码器;第三步,测试时对每道题用 LoRA 单独微调——每道题只有 2 到 5 组示范对,模型得从这几组示范里“现学”规则。值得一提的细节是,NAT-ARC 直接用了 MAE 的公开 checkpoint,没有额外花一分钱预训练。
不过该 checkpoint 原本为更大尺寸的 ImageNet 图片设计,而 ARC 格子只有 64×64 像素。为此 NAT-ARC 丢弃原始 patch embedding 和位置编码,只保留 backbone 权重,换成 2D RoPE 作位置编码。简单说,它只保留 MAE 学到的视觉特征提取能力,把与图像尺寸绑定的空间感知部分全部换掉重新学习。
为什么看猫能帮上抽象推理
论文用注意力可视化给出线索:把无预训练、ImageNet MAE 预训练、ARC 风格格子 MAE 预训练三种模型放在同一道题前,观察它们尚未训练 ARC 时的注意力分布。随机初始化的模型注意力均匀分散、毫无重点;而 ImageNet 预训练过的模型已经能区分前景和背景,注意力自动聚焦到格子中有意义的图案区域。这个模型从没见过 ARC 格子,却在 ImageNet 上学到的“把物体从背景里认出来”的能力,在格子上天然生效了。
进一步的任務拆解显示,预训练显著提升的 15 道题集中在两类:6 道属于“匹配—复制”(识别匹配的对象、颜色或图案并复制结构),6 道属于“连通区域推理”(识别、填充或重着色空间上连通的区域)。这两类能力恰好对应自然图像里的视觉先验——在 ImageNet 上看猫学到的“把猫从草地背景里分出来”,到了 ARC 就成了“把连通彩色区域从格子里认出来”。
数据与那个“酷到出圈”的实验
NAT-ARC 在 ARC-1 上的最好单模型采用 huge 尺度、0.6B 参数,pass@2 达到 63.4±0.7%;把三种预训练策略训出的模型池化做多数投票后,达到 70.2±0.6%,总参数约 2B。
论文里最酷的一个验证是:研究者训了一个 autoencoder,把 ImageNet 图像映射到 60×60、10 种颜色的离散格子表示,相当于把一张猫片“翻译”成 ARC 格子;然后用 NAT-ARC 对它执行 ARC 变换——旋转 180°、加一圈蓝色边框——再解码回像素。结果猫确实被转了,边框也确实加上了。这个实验把“自然图像与 ARC 格子共享同一套表征空间”从统计数字变成了可视化证据。
趋势洞察
这篇论文最重要的发现,是预训练打通了视觉路线的 scaling 瓶颈:没有预训练时,模型从 large 到 huge 反而掉点;加上 ImageNet 预训练后,base、large、huge 三个尺度一路向上,模型越大效果越好。
在 LLM 统治 ARC 赛道的当下,这条纯视觉路线用更小的参数量证明:抽象规则和视觉表征之间的连接,可能本来就存在。它也提醒行业,通往通用智能的路未必只有“把一切翻译成文字”这一条。
论文地址:https://eccv.ecva.net/virtual/2026/poster/5527
本文地址:https://www.163264.com/16047