标签: 高效推理

0

67 美分训练的小型 Transformer,为何能在 ARC 上超过许多大模型

一位独立开发者用单张 RTX 5090 训练约 1.5 小时,让一个小型自回归 Transformer 在 ARC-AGI-1 公共评测中取得 44% 的成绩,公开估算训练成本只有 0.67 美元,并在相同测试时训练口径下达到部分复杂方法的水平。这项结果容易被概括成“小模型击败大模型”,但其技术价值并不在参数规模竞赛,而在样本效率、任务内训练、数据增强和评测口径。模型会在测试阶段利用无标签评测题共同适配,训练数据也经过精心构造;它证明简单架构还有很大优化空间,却不能据此断言小模型已经具备通用推理能力。