看了一圈ARC-AGI的榜单,大公司还在那儿吭哧吭哧用LLM堆数据、烧钱做SFT,结果人家用个简单的自回归Transformer,从头训练1.5小时,直接干翻了之前不少模型。这成本对比,简直是“十倍速”效率的完美体现。
最讽刺的是,这帮搞LLM的总爱吹“泛化能力”,结果在ARC这种考验抽象推理的benchmark上,性能提升居然主要靠的是“后训练”和“合成数据”。说白了,很多模型只是在学习解决特定的ARC任务,而不是真正学会了抽象推理。这窗口期不就来了吗?说明这个赛道远没到终局,小团队靠架构和训练技巧的巧劲,完全有机会弯道超车。格局打开,别老盯着大模型那一亩三分地了。