国产世界模型登顶双榜,这次赢在物理规律理解

WorldArena榜单更新了,这是具身世界模型的权威评测。这次排第一的是Manifold AI的Worldscape 0.2模型,在物理规律遵循和多源交互理解上拿了高分。一起上榜的还有英伟达、谷歌这些国外公司,以及一些国内团队。

WorldArena这个评测体系是国内外好几个顶尖高校和机构一起搞的,现在算是领域内的国际标准。它不光看生成的画面质量,还要评动作质量、内容一致性、物理遵循性、3D准确性这些,挺全面的。说白了就是看模型懂不懂真实世界的物理规律,做的动作精不精确,规划稳不稳定。另外还测了模型作为数据引擎、策略评估器和动作规划器的能力,最后结合人类打分,算出一个综合指数。


WorldScape 0.2这次能拿第一,不是靠某一项特别强,而是综合表现好。具体来看:

  • 综合感知得分第一:在视觉质量、运动质量、一致性、可控性这些维度上,总分排第一,而且各项能力比较均衡,没有明显短板。
  • 物理规律遵循断层领先:很多生成模型只管画面好看,不管物理上对不对。WorldScape 0.2这项指标得分最高,而且领先优势很大。说明它真的理解了重力、摩擦力、碰撞这些力学逻辑,生成的东西不仅像,而且在物理上是对的。
  • 三维空间理解力强:在3D准确性这个难点上也表现很好,处理机械臂操控、视角切换、物体遮挡时,能保持精确的几何结构,避免了空间扭曲或者画面变“纸片”的问题。

其实就在上个月,另一个权威榜单WorldScore也更新了,当时Manifold AI的WorldScape 0.1模型就在那拿了第一(静态和动态两项指标都是第一),并且保持到现在。


WorldScore榜单是检验通用世界模型实力的,测试很严苛。Manifold AI的WorldScape 0.1模型总分排全球第一,同场竞技的包括李飞飞团队、MIT、阿里、Runway、智谱、MiniMax、腾讯混元等团队。
过去的世界模型很多都是“重渲染、轻规律”,视频看着精美,但一到复杂运动和多步控制就容易出错。WorldScape恰恰在物理和交互这些难啃的指标上拉开了差距,这说明它不止是画面像,底层物理逻辑也是对的。


还有一个点,WorldScape模型的参数量只有其他前排模型的10%,但表现更好,这说明它的空间智能密度和推理效率很高,对部署到边缘设备是利好。

不到一个月,模型从0.1进化到0.2又拿了第一,核心是用了MoE架构。
MoE在大语言模型里已经很成功了,能让模型更高效地学习。把它用到世界模型里特别重要,因为世界模型要处理物理、感知、决策这些不同性质的任务。MoE可以让不同的专家网络分别负责视觉动态、移动交互、操作推理等,然后动态组合起来,这样既能让模型能力变强,又不会让不同领域的知识互相干扰。WorldScape这次快速迭代并再次登顶,核心驱动力就是MoE,主要体现在三方面:


1. 多专家协同泛化:模型不再只做单一任务,而是构建了一个支持多源控制信号协同学习的统一架构。在保持基础空间交互能力的同时,把机械臂操控这种复杂行为也纳入了多专家生成范式,让不同控制方式能互相促进。
2. 统一空间表征:模型把几何、语义、物理这些不同性质的表征在同一个隐式空间里对齐和融合。这让它在长程交互中不仅能保持空间结构稳定,还能保证语义连贯和物理合理。
3. 多阶段持续学习:模型用了分阶段训练的策略,通过灌入大量世界知识和深度结合各种控制信号,显著增强了生成内容对真实物理规律的遵循能力。它不再只追求“画面流畅”,而是追求“运动符合物理和常识”。
Manifold AI在多个主流评测里的表现,以及模型扩展能力的验证,让人觉得世界模型的“GPT3时刻”可能快来了。

这有啥用,能赚钱吗?

是不是说以后机器人会更聪明了?我不太确定,但听起来对自动驾驶有帮助吧,小白问一下,这种模型现在能下载试用吗?

又来了,登顶了,赢麻了,下周是不是又要发新版本继续赢?榜单看看就好,真落地了再说。

想复现一下看看效果。大概步骤是先去GitHub找找有没有开源代码或论文,没有的话只能等官方放demo。然后准备一下测试数据集,重点测一下它提到的物理规律遵循,比如抛物体的轨迹或者碰撞后的反应。最后对比一下自己常用的基线模型。

帖子说参数量只有其他模型的10%,这个数据具体是怎么对比的?是和榜单里哪些模型比的?是总参数量还是激活参数量?另外,“空间智能密度”这个说法有公认的定义或量化指标吗?还是只是宣传用语?

之前做机械臂的抓取仿真也遇到过类似问题,模型生成的画面很漂亮,但规划出的抓取位姿在物理仿真里一跑就穿模或者打滑,就是因为物理规律没学好。如果这个WorldScape真的在物理遵循上断层领先,那对我们做具身智能模拟的帮助就太大了。希望他们能尽快开放API或者提供云服务,我们团队很想接入测试一下,毕竟自己从头训练一个理解物理的世界模型成本太高了。

mark一下,等开源。

只说一点我的观察吧。其实很多搞CV的朋友早就吐槽过,现在的视频生成模型为了画面平滑和分辨率,牺牲了太多的物理真实性,比如水往坡上流,或者物体碰撞后动量不守恒。如果这个国产模型真能把物理规律理解作为核心卖点并且得到了榜单验证,那确实是个重要的进步方向。不过关键还得看泛化能力,在没见过的复杂场景下是不是还能保持稳定。另外MoE架构虽然好,但推理时的路由机制会不会带来额外的延迟,这在实时控制场景里可能是致命伤。

双榜是哪两个榜啊,文章里没说明白

仿真到实机那个gap是世界模型的命门

物理规律理解这块如果真做扎实就有意思了

激活参数那块他们文里没写明白,对比基准我也没看出来

榜单刷新太快,看看就好,落地才是真本事

这种榜单模型一般会放HF链接,但权重不一定全开放,多半要申请。

双榜第一不等于真好用,等开源验证