SOTA Sync
全部文章
模型进展2026-09-01

ARC-AGI 44% 只花 0.67 美元

一个 75M 参数的小型 Transformer 在单张 RTX 5090 上从零训练约 1.5 小时,以 0.67 美元取得 ARC-AGI-1 公开集 44%,但 private test 仍待验证。

ARC-AGI 常被用来检验模型能否从少量示例中发现抽象规则,再把规则应用到新的网格任务。围绕它的方案越来越复杂,但研究者 Mohamed Vakde 走了相反方向:用一个约 75M 参数的普通 Transformer,在单张 RTX 5090 上从零训练约 1.5 小时,拿到 ARC-AGI-1 公开评估集 44%、ARC-AGI-2 约 7% 的成绩,总云端计算成本只有 0.67 美元。

模型在 ARC-AGI-1 公开评估集上的成绩与其他方法对比模型在 ARC-AGI-1 公开评估集上的成绩与其他方法对比

这个结果的价值不只在便宜。它说明在 ARC 这类任务上,表示方式、数据增强和训练配方的选择,可能比递归结构或复杂推理模块更直接地决定结果。与此同时,44% 来自公开评估集,模型和超参数也围绕它反复迭代;在 private test 验证之前,不能把它等同于正式排行榜成绩。

#把每道题当成一次元学习任务

模型采用测试时训练:面对一道新 ARC 题目时,从头训练一个小模型,让它根据给出的输入—输出示例学习这道题的转换规则,再预测测试网格。所有题目共享同一套实现和超参数,但每道题都对应独立的训练过程。

输入表示包含网格位置、颜色和任务身份。作者使用三维 RoPE 来编码二维空间与序列位置,并加入 task embedding,让模型区分不同增强样本属于哪一道原始题。训练数据还通过颜色置换、旋转和翻转等方式扩充,最后保留最常出现的两个候选输出。

架构本身没有神秘组件:8 层 Transformer、SwiGLU、RMSNorm,再配合更现代的注意力实现。真正的进步主要来自大量便宜而快速的实验,例如减少无效增强、调整样本打乱方式、把 AdamW 换成 Normuon,以及只对输出区域计算损失。

#消融实验比总分更有信息量

只看 44% 容易把改进归因于某个新优化器,消融实验却显示空间与任务表示才是关键。三维 RoPE 换成一维位置编码后,成绩从 44% 跌到约 24%;去掉 task embedding 也降到相近水平。

位置编码和 task embedding 的消融结果位置编码和 task embedding 的消融结果

其他表示与训练配置的差距同样明显。部分压缩表示只能达到十几个百分点,而更贴近 ARC 二维结构的编码明显占优。作者还发现,只在输出 token 上计算损失能把成绩从约 40% 推到 44%,虽然测试损失反而更差,却让训练更稳定。这提醒我们:通用语言建模指标未必能直接预测离散推理任务的最终正确率。

不同表示、增强和训练设置的进一步消融不同表示、增强和训练设置的进一步消融

作者也专门检查了 ARC-AGI-2 中可能与训练集重叠的任务。移除额外数据后,ARC-AGI-1 仍能维持约 40%,代价是接近两倍计算量。这个对照并没有消除公开集调参带来的偏差,但至少把“成绩完全来自数据泄漏”的解释削弱了。

#便宜意味着可以更快证伪

0.67 美元覆盖的是所有任务的训练与推理总成本,它不能直接类比持续在线服务的单次请求价格;ARC 网格也远小于自然语言和多模态世界。这个结果更不意味着递归推理或大型模型已经没有价值。

它真正改变的是实验经济学:当一次完整运行不到一美元、不到两小时,个人研究者可以系统地做几十轮消融,而不是靠直觉堆结构。对 ARC-AGI 来说,下一步最重要的验证不是继续强调公开集的 44%,而是在未见 private test 上复现趋势,并确认低成本配方能否跨版本、跨任务稳定迁移。