各位 WorldArena 2.0 参赛者及社区:
感谢大家一直以来对 WorldArena 2.0 的关注、参与和建议。最近我们的成绩发布遇到了一些延迟,我们在此表示诚挚抱歉并进行解释:
除了我们短期参赛队伍提交过多导致算力紧张等原因之外,最重要的原因是我们的一项发现以及对应的社区反馈,需要我们使用更多的时间进行结果重测、数据分析、指标分析,以进行完善。我们将 leaderboard 设置为维护状态,在本项 announcement 发布后,维护状态将会结束。
今天,我们希望向大家详细说明对于 Motion Quality 指标发现的问题和收到的反馈,我们如何采纳社区的反馈、进行改进。
WorldArena 建立的初衷,是通过一套统一、可复现的评测体系,选出能够更准确地理解动作、预测环境状态变化,并真正服务于具身任务的世界模型。
其中,Track 1 重点评估世界模型在具身智能任务下的视频生成能力。但随着比赛规模的扩大和提交数量的增加,我们发现最近一些参赛队伍没有采用赛事组织方推荐的帧数、FPS(我们理解不同模型训练数据和推理的差异,所以没有对帧数、FPS 设置硬性要求,但是我们始终希望属于较为正常的范围),而是使用了非常极端的帧数、FPS,使得 Motion Quality 中的 Dynamic Degree、Flow Score 和 Motion Smoothness 三项指标,都取得了异常高的值。我们非常感谢一些队伍向我们告知了这一问题,并期待我们进行修正改进,同时提出了宝贵的修改建议。
我们对这些视频以及相关指标做了仔细的人工检查,发现了这种极端值并不代表了模型具备更完整、更准确或更连续的环境动态预测能力,而仅仅是指标计算导致的。
整体而言,基于我们的分析、以及一些参赛队伍主动给予我们的建议和反馈,Dynamic Degree、Flow Score 和 Motion Smoothness 三个指标的值如果大于一定范围后,数值差异与模型能力基本没有关系。因此,一个合适的方法是将 Dynamic Degree、Flow Score 和 Motion Smoothness 的范围限制在 0 到 Ground Truth 的参考上限之间。因此,分数计算方式应为:
其中,GT Reference Score 是 Ground Truth 在相同数据集和相同评测协议下得到的对应指标分数。采用这一参考上限是一项对参赛排行影响非常小的修正,我们期望模型在正常范围内 PK 能力,不再让这部分非常不合理的增益继续影响排行榜。同时,也不代表着模型一定不能在某些局部指标上超过 Ground Truth。
以上是本次调整的核心结论:本次计分修正仅涉及 Dynamic Degree、Flow Score 和 Motion Smoothness 三项指标,其他指标保持不变。希望进一步了解问题表现、实测案例和数据,以及调整依据的读者,可继续阅读下文。
以下是具体的数据与指标分析(相关数据来源包括我们自己、我们收到的各类提交、向我们主动反映问题的队伍、以及其他社区成员的帮助)。
01
问题来源:指标与时间尺度之间的关系
WorldArena 2.0 Track 1 同时考察 Motion Quality、Content Consistency、Physics Adherence、3D Accuracy、Controllability,以及 embodied downstream tasks 中的功能价值。Motion Quality 包含三项指标。
- Dynamic Degree利用 RAFT 计算视频光流,并关注光流幅值最高的 top-5% 活跃区域,用于判断机器人手臂、操作对象等关键区域是否发生了足够明显的运动。
- Flow Score对相邻帧之间的稠密光流进行空间和时间统计,用于衡量视频整体的动态强度。
- Motion Smoothness通过视频帧插值模型,根据前后帧预测中间帧,再比较预测结果与实际中间帧的一致程度,用于评价运动在时间上的连续性。
这三个指标分别评估视频的局部运动、整体动态和连续性。它们有效发挥作用有一个基础前提:提交视频在时间尺度上应当基本一致,例如相似的总时长、帧率和相邻两帧的真实时间跨度。
一旦视频使用极端帧数或 FPS,例如把原本连贯的动作抽成极少几帧,这一前提就会被打破。同一段动作在计算逐帧数值时会产生明显偏差。即使模型没有生成更丰富、更准确的动态,帧间位移仍可能增大,从而提高 Dynamic Degree 或 Flow Score。Motion Smoothness 同样依赖前后帧与中间帧的关系;时间采样尺度改变后,分数所对应的物理含义也会变化。
我们接受模型在合理物理特性下表现出显著运动,也接受单项指标超过 Ground Truth。此次需要修正的问题是:部分高分由视频时间尺度变化引发,并没有对应模型对环境动力学建模能力的实际提升。
02
实际案例分析
我们从测试集中选取 Episode 1–4,对比 Ground Truth 与三个代表性模型的生成结果。为避免讨论指向特定参赛团队,页面只使用 Model 0、Model 1 和 Model 2,不披露模型真实名称。
三个代表性模型完整提交及 Ground Truth 的帧数与 FPS 统计
| 对象 | 帧数均值 | 帧数 P95 | 帧数 P5 | FPS 均值 | FPS P95 | FPS P5 |
|---|---|---|---|---|---|---|
| Ground Truth | 230.9 | 455.0 | 114.0 | 30.0 | 30.0 | 30.0 |
| Model 0 | 121.0 | 121.0 | 121.0 | 24.0 | 24.0 | 24.0 |
| Model 1 | 16.0 | 16.0 | 16.0 | 1.0 | 1.0 | 1.0 |
| Model 2 | 19.2 | 25.0 | 17.0 | 24.0 | 24.0 | 24.0 |
P5 表示 5% 的样本不高于该数值,P95 表示 95% 的样本不高于该数值,可用于观察分布两端。上表使用完整提交及 1,000 个 Ground Truth 视频的全量统计;下方视频卡片标注的是 Episode 1–4 单个视频的实际帧数与 FPS,两者统计口径不同。
Episode 1 四路视频的三项 Motion 指标实测结果
| 对象 | 帧数 / FPS | Dynamic Degree | Flow Score | Motion Smoothness | 说明 |
|---|---|---|---|---|---|
| Ground Truth | 123 / 30 | 0.1749 | 0.0525 | 0.6298 | 真实环境动态参考 |
| Model 0 | 121 / 24 | 0.1733 | 0.0608 | 0.6390 | 标准模型输出 |
| Model 1 | 16 / 1 | 0.3319 | 0.2579 | 0.7656 | 少帧、低 FPS |
| Model 2 | 9 / 24 | 0.5411 | 0.4028 | 0.9016 | 少帧、24 FPS 元数据 |
我们采用完全一致的评测流程对上述四组同 Episode 视频进行复核。检查重点是:分数增长是否真正体现了动作执行完整性、内容稳定性、物体交互准确性和状态转移合理性。结果表明,Model 1 和 Model 2 的高分没有转化为这些能力的实际改善。