WorldArena 2.0 Track 1 指标补充说明:基于社区反馈的改进

关于社区反馈的 Motion Quality 指标在极端帧数与 FPS 设置下出现异常高分的问题,以及本次评测将如何修正。

各位 WorldArena 2.0 参赛者及社区:

感谢大家一直以来对 WorldArena 2.0 的关注、参与和建议。最近我们的成绩发布遇到了一些延迟,我们在此表示诚挚抱歉并进行解释:
除了我们短期参赛队伍提交过多导致算力紧张等原因之外,最重要的原因是我们的一项发现以及对应的社区反馈,需要我们使用更多的时间进行结果重测、数据分析、指标分析,以进行完善。我们将 leaderboard 设置为维护状态,在本项 announcement 发布后,维护状态将会结束。
今天,我们希望向大家详细说明对于 Motion Quality 指标发现的问题和收到的反馈,我们如何采纳社区的反馈、进行改进

WorldArena 建立的初衷,是通过一套统一、可复现的评测体系,选出能够更准确地理解动作、预测环境状态变化,并真正服务于具身任务的世界模型。
其中,Track 1 重点评估世界模型在具身智能任务下的视频生成能力。但随着比赛规模的扩大和提交数量的增加,我们发现最近一些参赛队伍没有采用赛事组织方推荐的帧数、FPS(我们理解不同模型训练数据和推理的差异,所以没有对帧数、FPS 设置硬性要求,但是我们始终希望属于较为正常的范围),而是使用了非常极端的帧数、FPS,使得 Motion Quality 中的 Dynamic DegreeFlow ScoreMotion Smoothness 三项指标,都取得了异常高的值。我们非常感谢一些队伍向我们告知了这一问题,并期待我们进行修正改进,同时提出了宝贵的修改建议。

我们对这些视频以及相关指标做了仔细的人工检查,发现了这种极端值并不代表了模型具备更完整、更准确或更连续的环境动态预测能力,而仅仅是指标计算导致的。

整体而言,基于我们的分析、以及一些参赛队伍主动给予我们的建议和反馈,Dynamic DegreeFlow ScoreMotion Smoothness 三个指标的值如果大于一定范围后,数值差异与模型能力基本没有关系。因此,一个合适的方法是将 Dynamic DegreeFlow ScoreMotion Smoothness 的范围限制在 0 到 Ground Truth 的参考上限之间。因此,分数计算方式应为:

Adjusted Score = min(Original Score, GT Reference Score)

其中,GT Reference Score 是 Ground Truth 在相同数据集和相同评测协议下得到的对应指标分数。采用这一参考上限是一项对参赛排行影响非常小的修正,我们期望模型在正常范围内 PK 能力,不再让这部分非常不合理的增益继续影响排行榜。同时,也不代表着模型一定不能在某些局部指标上超过 Ground Truth。

以上是本次调整的核心结论:本次计分修正仅涉及 Dynamic DegreeFlow ScoreMotion Smoothness 三项指标,其他指标保持不变。希望进一步了解问题表现、实测案例和数据,以及调整依据的读者,可继续阅读下文。

以下是具体的数据与指标分析(相关数据来源包括我们自己、我们收到的各类提交、向我们主动反映问题的队伍、以及其他社区成员的帮助)。

01

问题来源:指标与时间尺度之间的关系

WorldArena 2.0 Track 1 同时考察 Motion Quality、Content Consistency、Physics Adherence、3D Accuracy、Controllability,以及 embodied downstream tasks 中的功能价值。Motion Quality 包含三项指标。

  • Dynamic Degree利用 RAFT 计算视频光流,并关注光流幅值最高的 top-5% 活跃区域,用于判断机器人手臂、操作对象等关键区域是否发生了足够明显的运动。
  • Flow Score对相邻帧之间的稠密光流进行空间和时间统计,用于衡量视频整体的动态强度。
  • Motion Smoothness通过视频帧插值模型,根据前后帧预测中间帧,再比较预测结果与实际中间帧的一致程度,用于评价运动在时间上的连续性。

这三个指标分别评估视频的局部运动、整体动态和连续性。它们有效发挥作用有一个基础前提:提交视频在时间尺度上应当基本一致,例如相似的总时长、帧率和相邻两帧的真实时间跨度。

一旦视频使用极端帧数或 FPS,例如把原本连贯的动作抽成极少几帧,这一前提就会被打破。同一段动作在计算逐帧数值时会产生明显偏差。即使模型没有生成更丰富、更准确的动态,帧间位移仍可能增大,从而提高 Dynamic Degree 或 Flow Score。Motion Smoothness 同样依赖前后帧与中间帧的关系;时间采样尺度改变后,分数所对应的物理含义也会变化。

我们接受模型在合理物理特性下表现出显著运动,也接受单项指标超过 Ground Truth。此次需要修正的问题是:部分高分由视频时间尺度变化引发,并没有对应模型对环境动力学建模能力的实际提升

02

实际案例分析

我们从测试集中选取 Episode 1–4,对比 Ground Truth 与三个代表性模型的生成结果。为避免讨论指向特定参赛团队,页面只使用 Model 0、Model 1 和 Model 2,不披露模型真实名称。

三个代表性模型完整提交及 Ground Truth 的帧数与 FPS 统计

对象帧数均值帧数 P95帧数 P5FPS 均值FPS P95FPS P5
Ground Truth230.9455.0114.030.030.030.0
Model 0121.0121.0121.024.024.024.0
Model 116.016.016.01.01.01.0
Model 219.225.017.024.024.024.0

P5 表示 5% 的样本不高于该数值,P95 表示 95% 的样本不高于该数值,可用于观察分布两端。上表使用完整提交及 1,000 个 Ground Truth 视频的全量统计;下方视频卡片标注的是 Episode 1–4 单个视频的实际帧数与 FPS,两者统计口径不同。

Episode 1 四路视频的三项 Motion 指标实测结果

对象帧数 / FPSDynamic DegreeFlow ScoreMotion Smoothness说明
Ground Truth123 / 300.17490.05250.6298真实环境动态参考
Model 0121 / 240.17330.06080.6390标准模型输出
Model 116 / 10.33190.25790.7656少帧、低 FPS
Model 29 / 240.54110.40280.9016少帧、24 FPS 元数据

我们采用完全一致的评测流程对上述四组同 Episode 视频进行复核。检查重点是:分数增长是否真正体现了动作执行完整性、内容稳定性、物体交互准确性和状态转移合理性。结果表明,Model 1 和 Model 2 的高分没有转化为这些能力的实际改善

03

Episode 1–4 视频对照

每个 Episode 按相同顺序展示 Ground Truth、Model 0、Model 1 和 Model 2。可以单独播放,也可以使用右侧按钮同时播放四个视频。

Episode 1

Ground Truth123 frames · 30 FPS
Model 0121 frames · 24 FPS
Model 116 frames · 1 FPS
Model 29 frames · 24 FPS

Episode 2

Ground Truth487 frames · 30 FPS
Model 0121 frames · 24 FPS
Model 116 frames · 1 FPS
Model 213 frames · 24 FPS

Episode 3

Ground Truth312 frames · 30 FPS
Model 0121 frames · 24 FPS
Model 116 frames · 1 FPS
Model 217 frames · 24 FPS

Episode 4

Ground Truth159 frames · 30 FPS
Model 0121 frames · 24 FPS
Model 116 frames · 1 FPS
Model 29 frames · 24 FPS

04

代表性时间采样 Case

Model 1:16 帧、FPS 为 1

强制将 FPS 设为 1,会在评测时将相邻两帧的时间跨度拉长至 1 秒,打破指标默认的时间换算逻辑,从而引发异常高分。逐帧检查显示,视频的动作完整度、画面稳定性及交互准确性并未得到实质提升

对象DynamicFlowSmoothness
Ground Truth0.17490.05250.6298
Model 10.33190.25790.7656

Model 2:24 FPS,平均 19.2 帧

当视频总帧数变少时,原本分散在几十帧中的动作变化被集中到少数相邻帧对中。单个帧对的位移因此更明显,基于光流的指标会把这种时间压缩解释为更剧烈的运动。

对象DynamicFlowSmoothness
Ground Truth0.17490.05250.6298
Model 20.54110.40280.9016

Model 1 与 Model 2 的共同点,是高分主要来自时间表示进入指标敏感区间,而实际视频没有表现出相应幅度的世界模型能力提升

05

Episode 1–4 完整指标

以下表格列出四组视频的 15 项逐视频指标。12 项均值排除了 Dynamic Degree、Flow Score 和 Motion Smoothness;15 项 EWMScore 保留全部指标。点击 Episode 标题可展开或收起。

缩写:IQ / Image Quality;AQ / Aesthetic Quality;JEPA / JEPA Similarity;DD / Dynamic Degree;MS / Motion Smoothness;SC / Subject Consistency;BC / Background Consistency;PC / Photometric Consistency;TA / Trajectory Accuracy;DA / Depth Accuracy;IF / Instruction Following;SA / Semantic Alignment。Ground Truth 的 Trajectory Accuracy 按与参考视频完全匹配修正为 1.0。

06

进一步验证与调整依据

为区分模型能力提升与时间表示带来的分数变化,我们从 0 training step 开始训练模型,在若干固定 checkpoint 上使用完全一致的视频生成参数和评测协议,观察模型质量随训练改善时三项指标的正常变化范围。

Training Step 与 Motion Metrics

实线表示各 checkpoint 的实测结果,底层淡色曲线表示局部平滑趋势。三项指标进入正常训练阶段后没有持续单调上升;图中数值采用百分制。

现有实验观察是:随着训练推进,模型在动作完成度、内容稳定性、动态合理性和整体视觉质量上持续改善;但进入正常训练阶段后,相关 Motion 指标逐渐进入相对稳定区间,并没有产生与异常提交相同幅度的增长。相反,在模型 checkpoint 不变时改变视频时间采样设置,却可以显著改变相关分数

选择 GT Reference Score 作为当前上限,并不是把真实视频定义为三个自动化指标的理论最优值。生成模型完全可能在运动平滑度、局部动态强度或其他单项属性上超过某个 Ground Truth 样本。采用 GT 作为当前版本的参考上限,是因为它来自真实环境动态分布,为现有评测协议提供稳定、可复现且与目标任务相关的参照点。

GT cap 更准确的含义是:当前评测协议仍能可靠提供正向 leaderboard reward 的保守饱和点,而不是世界模型能力的上限。它保留三项指标识别运动不足、动态退化和时序不连续的能力,同时避免缺乏可靠解释性的超额分数继续放大榜单差异。

07

执行与后续整改

新规则将公平统一应用。更新后的 leaderboard 和相关指标代码调整将同步公布。

我们的目标不变:让分数差异尽可能来自具身世界模型的准确度、可靠度与实际价值

如存在疑问,请通过官方联系邮箱保持积极联系。我们会认真对待每一次反馈。

WorldArena 全体主办团队
2026 年 08 月 11 日