WorldArena榜单更新了,这是具身世界模型的权威评测。这次排第一的是Manifold AI的Worldscape 0.2模型,在物理规律遵循和多源交互理解上拿了高分。一起上榜的还有英伟达、谷歌这些国外公司,以及一些国内团队。
WorldArena这个评测体系是国内外好几个顶尖高校和机构一起搞的,现在算是领域内的国际标准。它不光看生成的画面质量,还要评动作质量、内容一致性、物理遵循性、3D准确性这些,挺全面的。说白了就是看模型懂不懂真实世界的物理规律,做的动作精不精确,规划稳不稳定。另外还测了模型作为数据引擎、策略评估器和动作规划器的能力,最后结合人类打分,算出一个综合指数。
WorldScape 0.2这次能拿第一,不是靠某一项特别强,而是综合表现好。具体来看:
- 综合感知得分第一:在视觉质量、运动质量、一致性、可控性这些维度上,总分排第一,而且各项能力比较均衡,没有明显短板。
- 物理规律遵循断层领先:很多生成模型只管画面好看,不管物理上对不对。WorldScape 0.2这项指标得分最高,而且领先优势很大。说明它真的理解了重力、摩擦力、碰撞这些力学逻辑,生成的东西不仅像,而且在物理上是对的。
- 三维空间理解力强:在3D准确性这个难点上也表现很好,处理机械臂操控、视角切换、物体遮挡时,能保持精确的几何结构,避免了空间扭曲或者画面变“纸片”的问题。
其实就在上个月,另一个权威榜单WorldScore也更新了,当时Manifold AI的WorldScape 0.1模型就在那拿了第一(静态和动态两项指标都是第一),并且保持到现在。
WorldScore榜单是检验通用世界模型实力的,测试很严苛。Manifold AI的WorldScape 0.1模型总分排全球第一,同场竞技的包括李飞飞团队、MIT、阿里、Runway、智谱、MiniMax、腾讯混元等团队。
过去的世界模型很多都是“重渲染、轻规律”,视频看着精美,但一到复杂运动和多步控制就容易出错。WorldScape恰恰在物理和交互这些难啃的指标上拉开了差距,这说明它不止是画面像,底层物理逻辑也是对的。
还有一个点,WorldScape模型的参数量只有其他前排模型的10%,但表现更好,这说明它的空间智能密度和推理效率很高,对部署到边缘设备是利好。
不到一个月,模型从0.1进化到0.2又拿了第一,核心是用了MoE架构。
MoE在大语言模型里已经很成功了,能让模型更高效地学习。把它用到世界模型里特别重要,因为世界模型要处理物理、感知、决策这些不同性质的任务。MoE可以让不同的专家网络分别负责视觉动态、移动交互、操作推理等,然后动态组合起来,这样既能让模型能力变强,又不会让不同领域的知识互相干扰。WorldScape这次快速迭代并再次登顶,核心驱动力就是MoE,主要体现在三方面:
1. 多专家协同泛化:模型不再只做单一任务,而是构建了一个支持多源控制信号协同学习的统一架构。在保持基础空间交互能力的同时,把机械臂操控这种复杂行为也纳入了多专家生成范式,让不同控制方式能互相促进。
2. 统一空间表征:模型把几何、语义、物理这些不同性质的表征在同一个隐式空间里对齐和融合。这让它在长程交互中不仅能保持空间结构稳定,还能保证语义连贯和物理合理。
3. 多阶段持续学习:模型用了分阶段训练的策略,通过灌入大量世界知识和深度结合各种控制信号,显著增强了生成内容对真实物理规律的遵循能力。它不再只追求“画面流畅”,而是追求“运动符合物理和常识”。
Manifold AI在多个主流评测里的表现,以及模型扩展能力的验证,让人觉得世界模型的“GPT3时刻”可能快来了。