
本文选自 Horizon 2026年9月2日技术简报。
摘要
一位独立开发者用单张 RTX 5090 训练约 1.5 小时,让一个小型自回归 Transformer 在 ARC-AGI-1 公共评测中取得 44% 的成绩,公开估算训练成本只有 0.67 美元,并在相同测试时训练口径下达到部分复杂方法的水平。这项结果容易被概括成“小模型击败大模型”,但其技术价值并不在参数规模竞赛,而在样本效率、任务内训练、数据增强和评测口径。模型会在测试阶段利用无标签评测题共同适配,训练数据也经过精心构造;它证明简单架构还有很大优化空间,却不能据此断言小模型已经具备通用推理能力。
ARC 测试的不是知识问答
ARC-AGI 由 François Chollet 提出,每道题包含少量输入—输出彩色网格示例,系统需要归纳变化规则,再将规则应用到新的输入网格。题目很少依赖百科知识,关注的是面对新任务时能否从有限示例中形成有效程序。人类通常可以借助物体、边界、数量、对称、连通性等先验迅速理解题目,机器则需要在高维组合空间中寻找规律。
这使 ARC 与常规语言基准不同。大模型可通过预训练积累海量知识,但积累的知识未必转化为对陌生抽象规则的高效学习。ARC-AGI-1 也不是“AGI 及格线”:它只测量流体智能的一部分,解决该基准既不是通用智能的充分条件,也不能覆盖现实世界中的语言理解、长期规划和社会交互。
公共评测还存在数据暴露问题。题目和答案长期公开后,前沿模型可能在预训练或后训练中见过相关材料。因此,比较公共榜成绩时,必须区分从零训练、测试时训练、预训练大模型和使用合成数据的方案。把它们放在同一张“每题成本”图上,容易忽略大模型此前投入的巨大离线训练成本。
小模型是怎样工作的
该方案把每个网格输入—输出对序列化为 token,用小型 Transformer 做自回归预测。为了让网络识别二维结构,模型加入三维 RoPE 位置编码;每个任务还有独立的可学习嵌入,帮助模型区分题目。训练与推理阶段会对颜色和网格进行旋转、翻转等二面体变换,预测完成后再做逆变换,通过多个增强视角投票得到答案。
它采用测试时训练:模型从头在训练题以及评测题的已知输入部分上共同训练,评测输出标签保持隐藏。这个过程不是把测试答案喂给模型,却会利用评测输入的分布进行适配。因此,成绩更适合与同样采用测试时训练的方法比较,不能简单与一次前向推理的大模型并列。
作者报告,主要提升来自几组并不神秘的改动。网络由 4 层扩到 8 层;前馈层从 GELU 换为 SwiGLU;LayerNorm 换为 RMSNorm;训练数据更加多样,混洗更充分;损失函数只计算输出 token,而不再要求模型重构输入。速度方面采用变长 Flash Attention、紧凑序列打包和 Flex Attention 推理内核,优化器则由单独 AdamW 调整为 NorMuon 配合辅助 AdamW。
这些变化说明,小数据任务对训练细节极其敏感。大量填充 token、相似增强样本聚集、目标函数把容量消耗在输入重建上,都会让小模型的有效样本效率下降。架构升级的价值往往需要和数据管线、批处理方式一起看。
44% 成绩应该怎样理解
44% 是 ARC-AGI-1 公共评测上的结果,作者同时报告 ARC-AGI-2 约 7%。两个数字之间的落差很重要:它表明模型在第一代任务上形成了有效能力,但面对更难、组合性更强的新题时仍受到明显限制。一个方法在 ARC-1 上进步,不代表它学会了可无缝迁移的通用抽象推理。
训练数据加入了 ARC-2 中与 ARC-1 不重叠的任务。作者明确过滤重复题,并提供移除这部分数据后的消融:成绩约降至 40%,计算量需要增加。这个说明有助于排除最直接的标签泄露,但独立复现仍需检查过滤脚本、数据版本、随机种子和提交规则。
“67 美分”是云算力或电力口径下的训练成本估算,不包含研究时间、硬件购买、此前实验和代码开发。它适合说明单次迭代便宜,不适合与大模型全生命周期成本做严格财务比较。更有价值的指标是:给定相同数据、相同算力和相同测试规则,不同方法能取得多少性能。
对大模型路线的启示
这一实验没有否定规模化。相反,它提示研究者应把“模型规模”和“学习效率”分开。大模型擅长吸收广泛知识和提供统一接口,小模型可在结构明确、数据有限的任务上进行快速适配。很多工业问题——网格变换、排产规则、参数校核、缺陷分类——更接近受约束任务,不一定需要每次调用通用大模型完成全部计算。
更现实的系统可能由多层模型组成:通用模型理解自然语言和任务背景,小型专用模型执行结构化推理,规则引擎检查硬约束,求解器负责精确计算。小模型训练成本低,企业可以按设备、产线或工艺快速迭代,并把数据留在本地。
但不能因为模型小就忽视验证。任务专用模型容易在固定数据增强和评测规则上过拟合,对颜色数量、网格尺寸或规则组合的轻微变化可能失效。部署前应设计分布外测试、对抗样本和失败回退,而不是只看平均榜单成绩。
结语
这项工作最有意义的地方,是用低成本实验重新打开了一个问题:当数据很少、任务不断变化时,怎样让模型更有效地学习?现代 Transformer 组件、正确的目标函数、数据多样性和高效内核共同把简单方案推到了此前需要复杂系统才能达到的位置。它证明“简单架构还有余量”,尚未证明“小模型拥有通用智能”。如果后续结果能在私有测试集和独立实现中复现,它会为高效推理与工业专用模型提供很好的研究样本。
参考资料
- Mithil Vakde, 44% on ARC-AGI-1 in 67 cents
- ARC Prize Foundation, What is ARC-AGI?
- François Chollet, On the Measure of Intelligence
- ARC Prize Foundation, ARC-AGI-2 Technical Report
- Dao et al., FlashAttention: Fast and Memory-Efficient Exact Attention