跳到文章正文
行业/好文 编辑推荐

星动纪元 VPP2 登顶 RoboDojo 全球第一:不靠外挂、不加数据,压过 GPT-6-Astra

世界动作模型(WAM)赛道,中国团队直接冲到了全球第一。清华唯一持股的嫡系具身公司星动纪元,其自…

世界动作模型(WAM)赛道,中国团队直接冲到了全球第一。清华唯一持股的嫡系具身公司星动纪元,其自研世界动作模型 VPP2 一举登顶 RoboDojo 仿真榜单,综合平均成功率 32.26%、平均得分 39.26 分,双双第一,把 GPT-6-Astra、Physical Intelligence 的 π0.5、英伟达 GR00T-N1.7 等一众全球头部具身模型甩在了身后。

一分钟速览

  • 星动纪元自研世界动作模型 VPP2 登顶 RoboDojo 仿真榜单,成功率与得分双第一;
  • 相比 GPT-6-Astra(成功率 22.48%、得分 28.97),VPP2 分别领先 9.78 个百分点和 10.29 分;
  • 未额外加数据、未用 Agent RSI 等增强手段,仅靠标准数据集;
  • 真机部署到 ALOHA 双臂机器人,10 类零样本操作平均成功率 58.5%,高于 π0.5 的 40%。

RoboDojo:把机器人拉出舒适区

RoboDojo 号称具身智能界的「珠穆朗玛峰」,由香港大学 MMLab 牵头、全球近 20 所顶尖学术机构共同建设。它专挑机器人不擅长的地方出题:换个环境还会不会干活?东西摆歪了还能不能抓准?任务做到一半还记不记得前面发生了什么?仿真测试包含 42 项双臂操作任务,覆盖泛化、精准操作、长程任务、记忆、开放词汇指令理解五个维度。传统模型在熟悉任务上可能接近满分,一旦环境、物体位置、任务组合变化,成功率就明显下降,而 VPP2 恰恰在这种「变化」里拿到了第一。

解耦与排序:VPP2 的技术路线

VPP2 的突破瞄准了世界动作模型的老大难问题:预测错了,动作就跟着错。它给出的解法,是先把视频预测能力练到足够强,再让机器人在陌生环境里真正动起来——重点不是「视频、动作一锅炖」,而是把两者「解耦」、重新「排序」。也因此,VPP2 没有额外加数据、也没用 Agent RSI 等增强手段,性能提升来自预训练,基座足够泛化,所以不靠外挂增强策略、不靠扩充数据「刷分」。

拆开五项能力维度看,VPP2 在泛化、精准操作、记忆三个维度同样拿下第一,这三项正好对应机器人进入真实世界的几道难关:换环境还能不能干活、操作能不能做准、连续任务能不能记住前序步骤。

从仿真到真机

榜单终究是仿真环境,团队进一步把 VPP2 部署到真实 ALOHA 双臂机器人上,测试抓取、放置、堆叠、折叠、倾倒等 10 类零样本操作任务。结果 VPP2 平均成功率 58.5%,高于 π0.5 的 40%,并在 10 类任务中拿下 9 类最佳。仿真第一证明标准评测下的能力,真机零样本则证明这些能力能迁移到真实物理世界。这一「双榜」成绩,让 VPP2 成为世界动作模型赛道里最有竞争力的选手之一。

WAM 赛道为何突然升温

世界动作模型(WAM)之所以被看作具身智能的新方向,是因为它试图让机器人像人类一样,先在「想象」中预测动作的后果,再落地执行。这种「先想后做」的范式,天然更适合处理长程任务和陌生环境。VPP2 的「解耦 + 重排序」策略,本质上是把视频预测和动作学习这两个互相牵制的目标拆开训练,避免「一锅炖」导致的相互干扰,从而让模型既会「看」也会「动」。随着 RoboDojo 这类统一评测的成熟,WAM 赛道的技术优劣正变得可量化、可比较,这对整个行业的健康发展是件好事。

本文地址:https://www.163264.com/16596