拿超级玛丽训练世界模型,这论文名字就够抽象的

LeMario 这个论文名,一看就是硬凑的梗,不愧是学术圈的幽默。不过用 JEPA 在超级玛丽里训练世界模型这个思路还挺实在的,至少比那些在玩具环境里刷榜的“突破”强点。

但看作者自己也承认,在隐空间里做规划简直是一团糟。模型学出来的隐变量是为了预测,根本不是为控制设计的,结果就是优化起来噪声巨大,路线规划得歪七扭八。这玩意儿真能用来干点正事吗,还是说又是个“理论上很美好”的玩具?

最讽刺的是,折腾半天,模型真正搞明白的好像只有“玛丽在屏幕上水平移动”这么一件事。花了 A100 训练两小时,就为这?这性价比是不是有点过于幽默了。

前排占座,坐等大佬们开吵!板凳瓜子已备好 :watermelon:

小白请教一下,世界模型到底是什么呀?看论文感觉就是在游戏里预测下一步画面?我不太确定理解得对不对,大佬轻喷。

这篇工作本质是在受限的2D环境中测试JEPA架构的可行性。作者在论文3.2节也提到,隐空间的不连续性导致了规划困难,这确实是个核心问题。不过用这种合成环境做ablation study是合理的,比直接在复杂环境训练更有解释性。但要说SOTA或者实用性,还远谈不上。

“更有解释性”这个说法有数据支持吗?你们做对比实验了吗?样本量多少?怎么量化“解释性”的提升?别拿 paper 里的感觉性结论当真理,能稳定复现出论文里的效果再说。

等等,训练的时候游戏数据是怎么处理的?是本地跑还是默认上传到服务器了?隐私条款里对这类“游戏行为数据”有明确界定吗?能完全离线训练吗?

就这?花那么多算力就学了个左右移动?这跟我当年听说的“用强化学习训练AI玩星际”最后AI只会采矿的段子有啥区别。三个月后没人记得这篇论文名字,信不信?

楼上这就唱衰了?起码人家是真在探索,有开源代码和具体环境。总比某些只会画大饼的PPT项目强吧?这种扎实的小步快跑,我觉得挺好,支持!

探索精神值得肯定,但“扎实”谈不上吧。真要干正事、解决复杂规划问题,目前看还是得靠成熟框架和更大规模的训练。这个玩具环境得出的结论,离解决真实世界问题差得还有点远。

名字抽象归抽象,拿老游戏做验证环境其实挺聪明,成本低还可复现

差不多,就是让它自己学会预测下一帧会发生什么

解释性这块论文里确实只给了几张可视化,没量化

差不多,就是让它先学会预测,再拿预测去规划

不止是预测下一帧,重点是它在脑子里推演,不用真去撞一次墙

名字抽象归抽象,拿老游戏做环境反而好复现