20%数据超GR00T N1.6、RoboDojo超WAM!StarVLA只用16卡训出全新VLA

机器之心
 来自北京

机器人 VLA 还在疯狂卷数据,StarVLA 团队这次却把目光放到了另一个问题上:除了继续 scale 数据以外,能不能让每一条数据都学得更值?

他们最新发布了面向 VLA 的 VLM 底座 VLAct。

VLAct 的整个 continued pre-training 只使用开源数据和 16 张 GPU,但成绩相当能打:RoboTwin 2.0 成功率达到 92.5%;在 RoboDojo 榜单中超过所有明确标注为 World Action Model(WAM)的模型;面对预训练阶段从未见过的 GR-1 机器人,只使用 20%的 RoboCasa-GR1 下游数据,就已经超过 NVIDIA GR00T N1.6 的全量数据基线。模型、Checkpoint、训练代码和 Pipeline 也全部开源。

图 1|VLAct 主要结果一览:RoboDojo、RoboTwin 2.0、RoboCasa-GR1,以及 16 GPUs 与全开源。(项目宣传图)

机器人数据

没法像互联网数据一样“爬”

过去几年,大模型已经证明了一条非常有效的路线:数据更多、模型更大、算力更强,能力就不断往上走。VLA 自然也希望复制这条 Scaling 路线。

但机器人领域有一个绕不开的现实:机器人轨迹不是网页数据,不能从互联网直接爬下来。每条数据都需要机器人真正在物理世界里完成操作,背后往往还有遥操作、数据采集和硬件成本。更麻烦的是,机器人最终面对的是几乎无限的场景、物体、任务和机器人形态组合。

所以 VLAct 并不是想否定 Data Scaling,而是补上另一个问题:在同样的数据预算下,能不能让机器人轨迹在 Backbone 里留下更多可以跨任务、跨 Action Head、甚至跨机器人迁移的知识?

图 2|Naive VLA pre-training 容易绑定预训练场景;VLAct 把目标转向更可迁移的 Action-aware Representation。

一个有点反常识的发现:

Action 学得更好,Backbone 不一定更好

VLAct 真正的起点,来自团队前期实验中一个很有意思的现象。现在很多 VLA 都会从一个 VLM 出发,挂上 Action Head,再用机器人数据继续训练。很自然的想法是:Action 预测越准,说明这次 VLA 预训练越成功。

但实验发现,并不一定。以 RoboTwin 为例,使用 OFT Head 做 continued pre-training 后,如果下游继续使用 OFT,成功率可以从 61.7%提高到 75.8%;但把同一个 Backbone 换成 PI Head,下游反而从 60.5%下降到 55.1%;换成 GR00T Head 甚至从 51.2%降到 28.9%。

换句话说:Policy 在原来的 Head 上变强了,不代表 Backbone 真的变得更通用。

图 3|Action supervision 会直接塑造 Backbone:同 Head 性能提升,并不自动转化为 Cross-head 迁移能力。

原因也很直观。Action Head 和 Backbone 是一起训练的,只用一种 Head 时,Backbone 很容易逐渐学会一种“最方便这个 Head 读取”的 Feature Geometry。对于当前 Policy,这当然很好;但换一个 Action Head、任务甚至机器人后,这些 Representation 未必还能继续复用。论文把这种现象称为 head-specific representation collapse。

于是 VLAct 把 continued pre-training 的目标重新定义了一遍:不是训练一个已经很会做动作的固定 Policy Initialization,而是训练一个能被不同 Action Head、不同任务、不同机器人继续利用的 VLM Backbone。

那怎么避免 Backbone 被“带偏”?

围绕这个目标,VLAct 没有重新发明复杂的 Policy Architecture,而是在 continued pre-training 阶段做了三件事。

第一,别把 VLM 原来学会的东西忘了。VLAct 保护 Vision Encoder 和较浅的 LLM 层,同时混入 Caption 数据,让模型在学习 Action 时尽量保住原来的视觉语言先验。

第二,别让一种 Action Head 说了算。VLAct 同时挂上 OFT、PI 和 GR00T 三种连续 Action Head,让它们共同读取一个 Backbone、预测同一套动作。这样 Backbone 想同时服务不同 Decoder,就不能只把信息组织成某一种 Head 最喜欢的形式。更重要的是,预训练结束后这些 Head 全部可以丢掉,下游重新初始化自己的 Action Head。

第三,不同机器人之间,该共享的物理语义就共享。例如“打开/关闭夹爪”在不同机器人上的物理意义高度相似,但不同机械臂的自由度和运动学结构又不能粗暴统一。因此 VLAct 只统一真正一致的 Action 维度,其他部分继续保持 Embodiment-specific。

图 4|VLAct 完整训练框架:Preserve VLM Prior、Multi-head Continuous Supervision、Partially Unified Action Space,下游重新初始化 Action Head。(论文 Figure 3 原图裁切)

RoboTwin 92.5%

RoboDojo 超所有 WAM

最终,这种 Representation 能不能迁移,还是得看结果。在 LIBERO-Plus 上,VLAct 达到 82.6%;到了双臂操作的 RoboTwin 2.0,Data Scaling 设置下 Clean 成功率进一步达到 92.5%,Random 设置也达到 90.8%。

在 RoboDojo 上,VLAct 取得 10.66 Score 和 7.60%的 Success Rate,并超过所有明确标注为 WAM 的参赛模型。也就是说,这套预训练并不是只在某一个机器人、某一个 Benchmark 上有效。

论文还在 Franka 真机上覆盖了单臂短时序、长时序、双臂协同,以及 Novel Object 和 Full Substitution 等 OOD 设置。

图 5|真实机器人评测任务:包括 In-domain 与 Out-of-domain、短时序、长时序和双臂操作。(论文 Figure 11 原图裁切)

20%数据

超过 GR00T N1.6 的 100%

最能体现迁移能力的实验来自 RoboCasa-GR1。GR-1 这种机器人在 VLAct continued pre-training 的数据里一次都没有出现过:预训练阶段模型看到的是 Franka、AgileX 等机器人,然后再把 Backbone 拿到 GR-1 上进行下游 Fine-tuning。

结果只使用 20% 的 RoboCasa-GR1 轨迹,VLAct 就达到 49.5%的成功率,已经超过 GR00T N1.6 和 Qwen3VL-OFT 的全量数据基线;当数据提高到 100%时,VLAct 进一步达到 54.0%。

图 6|论文 Figure 5:真机单臂/长时序/双臂结果,以及 RoboCasa-GR1 跨本体迁移;20%下游数据已超过公开 full-data baselines。

Beyond Data Scaling

让每条机器人数据“学得更值”

VLAct 并不是想证明“数据不重要”。机器人数据当然还需要继续 Scale,但由于机器人数据昂贵、稀缺,而且很难完整覆盖真实物理世界,Representation Quality 本身也应该成为 VLA Scaling 的一条独立轴线。

过去大家更常问:“还能收多少机器人数据?”VLAct 希望同时再问一句:“同样这些机器人数据,到底能让模型学到多少可以迁移的东西?”

整个 VLAct continued pre-training 基于 Qwen3-VL-4B,只使用公开机器人数据和 16 张 GPU 完成。目前模型权重、Checkpoint、数据处理及训练 Pipeline 均已开放,希望把一个更适合物理世界、也更 Research-friendly 的 VLM Backbone 交给 VLA 社区。

项目链接

项目主页:https://starvla.github.io/VLAct/

论文标题:Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models

论文地址:https://arxiv.org/abs/2608.27550

GitHub:https://github.com/starVLA/VLAct

Hugging Face:https://huggingface.co/collections/StarVLA/vlact

X: https://x.com/YSenqiao/status/2094260526075302194

图片

© THE END

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。

Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”

热点新闻