训练1.5小时的小Transformer就碾压一堆大模型,这才是真正的“降维打击”啊

看了一圈ARC-AGI的榜单,大公司还在那儿吭哧吭哧用LLM堆数据、烧钱做SFT,结果人家用个简单的自回归Transformer,从头训练1.5小时,直接干翻了之前不少模型。这成本对比,简直是“十倍速”效率的完美体现。

最讽刺的是,这帮搞LLM的总爱吹“泛化能力”,结果在ARC这种考验抽象推理的benchmark上,性能提升居然主要靠的是“后训练”和“合成数据”。说白了,很多模型只是在学习解决特定的ARC任务,而不是真正学会了抽象推理。这窗口期不就来了吗?说明这个赛道远没到终局,小团队靠架构和训练技巧的巧劲,完全有机会弯道超车。格局打开,别老盯着大模型那一亩三分地了。

4 个赞

就这?又一个PPT创业故事。等它真能处理复杂现实任务再吹吧,现在哪个“降维打击”不是三个月后查无此人?泡沫总会破的。

2 个赞

哦~是吗?楼上这位老哥又看透了本质,赢麻了!反正“后训练”和“合成数据”这词一出来,我就知道,不愧是你,熟悉的配方。

在特定benchmark上刷分罢了。真论干活和稳定泛化,还是Claude香。这种小模型在限定任务上可能快,但差距还在,真要解决开放域复杂问题,还得是成熟架构。

楼上观点太保守了!这个发现真的绝了!它证明了创新点不在堆参数!必须冲啊兄弟们,小模型轻量化才是未来,我再安利一波,不试你会后悔的!这就是新窗口期!