田晏林 发自 凹非寺
量子位 | 公众号 QbitAI
好家伙,世界动作模型(WAM)赛道,中国团队直接冲到了全球第一?!
而且,GPT-6-Astra、Physical Intelligence的π0.5、英伟达GR00T-N1.7等一众全球头部具身模型,这次都被甩在了身后。
出手的是一家中国机器人公司——清华唯一持股的嫡系具身公司,星动纪元。
近日,星动纪元自研的世界动作模型VPP2,一举登顶RoboDojo仿真榜单。
综合平均成功率32.26%,综合平均得分39.26分,两个指标双双第一。

关键是,这场比赛还真不好打。
RoboDojo号称具身智能界的「珠穆朗玛峰」,由香港大学MMLab牵头,全球近20所顶尖学术机构共同建设。
它专挑机器人不擅长的地方出题:换个环境,还会不会干活?东西摆歪了,还能不能抓准?任务做到一半,还记不记得前面发生了什么?
总之,想靠刷熟练度蒙混过关,没那么容易。
结果呢?
星动纪元VPP2不仅拿下综合第一,在泛化能力、精细操作、记忆能力三个维度上,也拔得头筹。

据说,这次VPP2没有额外加数据,也没用Agent RSI等增强手段,仅靠「标准数据集」,就把一众高手给卷了下去。
这代表着VPP2模型本身足够强,性能提升来自预训练,基座足够泛化,因此不靠外挂增强策略,不靠扩充数据「刷分」。
不是,哥们儿,这么夯的模型到底是怎么练出来的啊???
我们往技术路线里扒了扒,你别说,VPP2这次的突破,还真有点东西。
它瞄准了世界动作模型的一道老大难问题:预测错了,动作就跟着错。
VPP2给出的解法,是先把视频预测能力练到足够强,再让机器人在陌生环境里真正动起来。
从预测到行动,两种泛化能力一起提升。
从目前披露的多项测试结果来看,VPP2已经成为世界动作模型WAM赛道中,最有竞争力的选手之一。
世界动作模型WAM,卷出一个新冠军
具身智能行业有个挺尴尬的现象。
机器人Demo越做越炫,模型榜单分数也越来越高,但真要问一句,谁的机器人更聪明、更能干活?
还真不好回答。
比如让机器人抓杯子。在训练时见过的桌面上,它可能百发百中。结果换个杯子、挪下位置,立刻开始怀疑人生。
更别提那些需要连续执行多个步骤的任务了。

这也是为什么,RoboDojo这套评测值得关注。
它的目标是为具身智能建立统一、可复现的评测标准,仿真测试包含42项双臂操作任务,覆盖泛化、精准操作、长程任务、记忆、开放词汇指令理解五个维度。
说白了,就是把机器人拉出舒适区。
传统机器人模型在熟悉任务上可能接近满分,一旦环境、物体位置、任务组合发生变化,成功率可能明显下降。
RoboDojo专门对这类复杂情况进行考察,看机器人面对变化时,有多少泛化能力。
而VPP2这次交出的成绩单,相当亮眼。
平均成功率32.26%、平均得分39.26分,两个指标均位居榜首。
作为对比,在RoboDojo仿真基准的后训练评测中,GPT-6-Astra的平均成功率为22.48%,平均得分28.97分。
而VPP2分别领先9.78个百分点和10.29分。

△论文截图,基线模型数据取自官方排行榜
这里两个指标各有侧重:成功率看机器人能否完整完成任务;平均得分则衡量任务推进到了哪一步,即便没能全部完成,也能体现其阶段性表现。
两项指标均综合了五大能力维度的测试结果。
换句话说,VPP2不仅完成任务的比例更高,面对没能做完的任务,也体现出了更强的阶段性完成能力。
而且,这种领先并不局限于综合成绩。
拆开五项能力维度来看,VPP2在泛化、精准操作、记忆三个维度上,同样拿下第一。
这三项能力对应着机器人进入真实世界的几道难关:换个环境还能不能干活,操作能不能做准,以及连续执行任务时能不能记住前面的步骤。
综合成绩领先,关键能力也能打。
不过,RoboDojo再难,考场终究还是「仿真环境」。真到了物理世界,物体的摩擦、形变、位置偏差,又会陡生变数。
VPP2在仿真里展现出的泛化能力,到了真机上还能成立吗?
星动纪元也做了实验。
这次,团队直接把VPP2部署到真实ALOHA双臂机器人上,测试了抓取、放置、堆叠、折叠、倾倒等10类零样本操作任务。
也就是说,无需针对这些测试任务进行额外微调,机器人就得直接上手。
结果,VPP2再次交出领先成绩:平均成功率58.5%,高于π0.5的40%。

在10类任务里,VPP2拿下了9类最佳成绩。
这下有意思了。
榜单第一,证明的是它在标准评测体系里的能力;真机零样本操作,则进一步考察这些能力能否迁移到真实物理环境。
两份成绩单摆在一起,VPP2的技术优势就更值得深挖了。
要知道,VPP2走的是世界动作模型(WAM)路线。
这类模型的基本思路,是借助视频预测理解物理世界接下来会如何变化,再把这种预测转化为机器人动作。
但这条路线长期存在一个问题:视频预测得漂亮,不代表机器人真的会干活。
VPP2这次,偏偏就冲着这个问题去了。
从预测泛化到行动泛化,VPP2怎么做到的?
想理解VPP2的突破,先来看一个简单任务:让机器人把桌上的杯子放进盒子里。
对人类来说,伸手抓住、抬起来、放进去,几乎不用思考。
但机器人得判断杯子的位置、机械臂的运动轨迹、夹爪何时闭合,还要预测整个操作过程中,物理世界会发生什么变化。任何一步出了偏差,都可能翻车。
现有的世界动作模型(WAM),恰恰容易在这里出问题。
一方面,普通视频模型擅长生成画面,但画面看着合理,和符合真实物理规律是两回事。
比如要求抓左边的杯子,模型却预测抓起右边那个。视频照样能生成,机器人执行时却会直接跑偏。
另一方面,直接把动作学习加入视频模型,还可能损伤原本的泛化能力。
结果动作学会了,机器人换个环境却不会做了。
VPP2提出了一个很直接的判断:视频预测的质量,决定了动作的上限。

基于这一思路,星动纪元选择将视频预测与动作学习分阶段训练,重点不是「视频、动作一锅炖」,而是把两者「解耦」,重新「排序」。
星动纪元为此设计了一套三阶段训练策略:
第一阶段,事件级视频继续预训练,让模型学会预测完整操作过程。
第二阶段,固定时长视频后训练与蒸馏,让预测能力跟得上机器人实时执行的速度。
第三阶段,动作专家训练,将视频预测转化为具体动作,同时尽量保住原有的泛化能力。

三个阶段层层递进,最终指向两个核心突破:预测能泛化,行动也能泛化。
第一个突破:让视频预测具备泛化能力
VPP2首先要解决的,是机器人能否准确预测陌生任务中的物理变化。
星动纪元以阿里开源的Wan2.1-I2V-14B为基础,整合机器人操作、人类活动、通用视频等多种数据,覆盖不同机器人本体和操作方式。
不过,真正有意思的是它对数据的处理。
团队没有简单地把视频一股脑喂给模型,而是先将操作过程切分成语义完整的片段,再配上详细描述。
比如,不能只告诉模型「把杯子放进盒子」,还要明确是哪只机械臂、哪个杯子、哪个盒子,以及整个操作过程。
因为同一句模糊指令,可能对应无数种动作轨迹。
模型如果连操作对象都没搞清楚,自然很难准确预测未来。
VPP2索性把任务描述得更细,让语言指令和物理操作形成更稳定的对应关系。

更关键的一步,是事件级视频预测训练。
传统短时预测关注接下来几帧会发生什么,而VPP2直接让模型学习一次完整操作从开始到结束的变化。
从机械臂靠近杯子,到抓住杯子,再到放进盒子,模型要理解的是一整件事如何发生。
这样一来,面对新的物体、位置甚至操作任务,它才更有机会预测合理的物理变化。
在机器人操作视频的指令遵循测试中,14B参数的VPP2达到90%的成功率,而64B参数的Cosmos3模型为78%。

14B打赢64B。
这也说明,在物理操作预测中,参数规模并非唯一的胜负手,能否真正理解操作过程同样重要。
不过,预测得再准,机器人动不起来,也白搭。
第二个突破:让预测泛化变成行动泛化
这里有两道坎,一是速度,二是如何在学会动作的同时,保住视频模型原有的泛化能力。
第一道坎很好理解。如果让机器人干活,每个动作发生前都要花几秒生成视频,那么再强的预测能力也很难派上用场。
星动纪元选择先给预测模型提速。
团队将事件级预测模型进一步调整为固定8秒的视频片段预测,再通过一致性蒸馏,将多步计算压缩为单步生成。
最终,预测未来8秒的视觉变化,计算耗时约0.12秒。
第二道坎,稍微棘手一些。
前面好不容易让视频模型学会了预测陌生任务,结果加入动作训练后,模型反而只会执行熟悉的操作。
动作能力长出来了,泛化能力却丢了?VPP2要做的,就是同时跨过这两道坎。

VPP2引入一个0.9B参数的扩散Transformer(Action DiT),采用MoT架构,学习如何根据预测的未来状态生成机器人动作。
但星动纪元没有直接将视频预测模型(Video DiT)和动作专家一起从头训练。
在动作训练初期,视频模型的基础参数被冻结,仅通过LoRA进行适配,尽量避免动作训练破坏已有的预测泛化能力。
相当于先让机器人理解物理世界怎么变化,再训练它如何把这种「理解」转化为「动作」。
两种能力分阶段生长,又相互配合。
最终,视频预测约耗时0.12秒,动作专家约耗时0.1秒,整体动作片段生成延迟约为0.22秒。

当然,架构再漂亮,也得看最终效果。
前面提到的ALOHA真实机器人零样本测试,已经展现出VPP2将预测能力转化为陌生任务操作的潜力。
另外两套泛化测试,则进一步验证了这条路线。
LIBERO-Pro考察物体位置、任务要求变化后的操作能力,VPP2取得45.0%的总体成功率,其他基线模型最高为11.0%。
LIBERO-OOD则考察组合泛化,将熟悉的物体、布局和任务目标重新组合,形成此前没见过的新任务。
VPP2的总体成功率达到63.9%。

把这些结果放在一起看,VPP2的技术思路就清楚了。
先通过多源数据、详细任务描述和事件级预测训练,让模型更准确地预测物理变化。
再通过蒸馏加速、分阶段动作学习,将这种预测能力转化为实际操作,同时尽量保留原有的泛化能力。
具身智能的性能上限,显然还没到只能靠规模硬堆的地步。
VPP2再次说明,优化数据管线、调整训练范式,这些看似朴素的工程方法,仍然有机会带来可观的模型性能提升。
从GPT到WAM,物理AI正在形成新范式
预测能泛化,行动也能泛化,是VPP2作为世界动作模型WAM,最值得关注的核心突破。
但真实任务往往更加复杂。机器人不仅要知道怎么做,还得判断先做什么、后做什么。
这就需要更高层的认知与规划能力参与进来。
星动纪元这里贡献了一个思路:GPT负责想,VPP2负责做。
前者负责理解、推理和规划,把复杂任务拆解成明确步骤;后者负责预测物理世界如何变化,再将规划转化为具体动作。
这一思路,在VPP2论文中已经有了初步的实验支撑。
团队实际采用的是VLM高层规划器,由其负责语义理解、记忆和任务拆解,再将明确的子任务交给VPP2执行。
结果相当直观。在RoboDojo选定的长程任务测试中,引入VLM子任务规划后,平均成功率从27.6%提升至57.6%。


