• 手机站
  • 微信
  • 搜索
    搜新闻
    您的位置:首页 > 行业新闻

    突围GPT6!星动纪元VPP2登顶RoboDojo

    近日,星动纪元世界动作模型(WAM)VPP2(Video Prediction Policy ),以平均成功率(Avg SR)32.26%、平均得分(Avg Score)39.26分的成绩登顶 “具身智能界的珠穆朗玛峰”RoboDojo榜首,并拿下泛化能力(Generalization)、精细操作(Precision)、记忆能力(Memory)三项成绩第一。超越GPT-6 Astra、Physical Intelligence π0.5、英伟达GR00T-N1.7等模型。

    更关键的是,VPP2未使用任何额外数据或AgentRSI,仅仅使用标准数据集就斩获了榜首,更加体现了VPP2模型本身的优越性——性能提升来自预训练,不靠外挂增强策略,不靠扩充数据“刷分”。

    “具身智能界的珠穆朗玛峰”RoboDojo

    关于Robodojo榜单:RoboDojo是由香港大学MMLab牵头、全球近20所顶尖学术机构共建的具身智能统一评测基准,以“仿真+真机”全科大考和极致难度著称,被业界称为“具身智能界的珠穆朗玛峰”。它的价值不在于再造一个Benchmark,而在于为整个行业立下一把统一、可复现的标尺——让“看起来很厉害”变成“分数上见真章”,推动具身智能从Demo驱动走向可量化、可比较的工程化竞争。

    如何训练最强世界动作模型 (WAM)

    1.VPP2的起始:如何让WAM在开放环境下泛化?

    机器人学习领域最主流的范式之一,是“世界动作模型”(World Action Models, WAM):把视频生成模型“预测未来画面”的能力,迁移为机器人“该怎么动”的动作能力。直觉上很美好——一个能在脑海中推演未来的机器人,理应知道下一步该做什么。

    然而,实际情况是,几乎所有过往WAM的工作里根本没有任何开放环境的视频预测,都只能放出在特定领域过拟合的视频预测。一旦放到开放式环境中,WAM就经常预测出错误的运动,进而输出错误的动作。

    让WAM泛化性丢失的主要有下面两点原因:

    第一道坎:视频底座不是为 "操作" 而生:基础视频模型主要面向创意内容生成与美学质量优化,充满想象力,因此往往难以准确遵循细致的操作指令。

    第二道坎:后训练硬塞动作,反而让模型 "变笨":向预训练视频底座中引入动作专用组件或联合训练目标,会显著削弱其原有泛化能力——模型记住了几个特定动作,却丧失了对千变万化场景的适应力。VPP2的核心目标,就是保留视频模型的泛化性的前提下,加入action动作建模。

    2.VPP2:视频预测和动作生成都能泛化的WAM

    VPP2的最大特点是在视频预测和动作生成两方面都具备强零样本泛化能力。视频预测的质量,决定了动作的上限。因此正确的顺序不是"视频、动作一锅炖",而是把两者解耦、排序。

    先用海量、多样、坐标系统一的数据,把视频模型训练成一个真正可泛化的“未来预测器”;再分阶段、有节制地把动作能力“嫁接”上去。整套方法因此建立在两大工程之上——一个统一的数据底座和一条三阶段训练流水线。

    3.VPP2能泛化的【关键点-1】:优秀的数据处理管线

    ①数据处理流水线:过滤→分割→详细描述

    泛化能力跃升一半来自训练策略,另一半来自看似枯燥的数据工程。星动纪元首先构建了一个覆盖五类来源的大规模操作数据集,并对不同类型采用不同的过滤策略,以兼顾多样性与质量。原始视频进入训练前,要经过一条严格的处理流水线,核心目标是降低未来预测的不确定性:

    过滤——只保留末端执行器可见的片段;

    分割——按任务边界把长视频切成片段,并由视觉语言模型(VLM)合并相邻片段、微调起止点;

    描述生成——VLM 为每个片段生成包含任务说明、活动末端执行器、无歧义目标物体、摄像机视角四要素的详细描述。

    ②统一坐标系:两次对齐

    针对“同一动作方向各异”的顽疾,团队对占总量 80%以上的第一人称双臂数据做了双重对齐,这是VPP2最具实操价值的部分:

    对于多机位数据,团队将其编排成“T形合成图”:主视角位于左侧,两个辅助视角在右侧纵向堆叠;当辅助视角不足两个时,用黑色占位图像填充空缺。这样既保留了多视角信息,又形成了统一的输入规格。

    4.VPP2能泛化的【关键点-2】:合理的训练流程

    数据就位后,VPP2构建于预训练的Wan2.1-12V-14B视频模型之上,通过三个目标分明的阶段,依次完成“练眼—提速—练手”。

    ①阶段 1:事件级视频模型继续预训练

    给定一条演示视频,在整个事件范围内均匀采样N个未来帧,让模型学会从初始条件预测一个完整子任务的演变。这一阶段使用大规模事件级视频片段,目标是得到一个可泛化的视频预测模型,而不是急于输出动作。

    ②阶段 2:块级后训练+一致性蒸馏

    事件级视频片段时长不一,难以与动作的时间间隔严格对齐。VPP2改为在固定时域的视频块上后训练;更关键的是引入一致性蒸馏(Consistency Distillation):原本需要多步迭代去噪的生成过程,被蒸馏成只需单次前向即可出结果,为实时闭环扫清速度障碍。为强调单步生成,训练时以0.5的概率直接采样到终点时刻。

    ③阶段 3:跨数据集动作DiT预训练

    最后才引入动作模块:一个仅0.9B参数的动作专家,采用混合Transformer(Mixture-of-Transformers, MoT)架构,在跨机器人统一后的动作空间上,学习隐式逆动力学模型——即根据视频预测结果反推应执行的动作。动作模块以全新初始化的方式接入,且全程保留预训练视频表示,从而在注入动作能力时不破坏泛化性。

    ④VLM双重角色:用“详细描述”破除虚假相关,用“详细分层规划”打通长任务

    除了底层的视频—动作回路,VPP2还用一个VLM承担分层高层规划:面对“收拾餐桌”这类模糊长任务,VLM把它拆解为一串详细子任务描述,再依次交给动作专家。VPP2采用分层架构,由VLM负责高层推理、语义理解与记忆,动作专家负责底层执行。

    6张“成绩单”看VPP2到底强在哪?

    VPP2在视频预测、指令遵循、真实机器人、LIBERO泛化、RoboDojo仿真、高层规划六条战线上系统验证了方法。

    1.视频预测:超越英伟达Cosmos3-Super-64B

    图中展示了预训练VPP2对人手和机器人操作的视频预测(30步)。在大规模、多样化操作数据上训练后,模型可泛化到人手与多种机器人载体,并将1–3个摄像机视角编排为T形合成图。

    2.指令遵循:复杂空间任务上更可靠

    图中用红/绿圈标出目标物体,直观对比VPP2、Wan-14B、Cosmos3-64B的指令遵循能力。可以看到,在需要空间理解的复杂任务上,VPP2更准确地把动作落到指定物体上。

    3.真实世界ALOHA:零样本9/10类任务夺冠

    在真实ALOHA平台随机选取的10个任务类别上做零样本成功率测试;为公平比较,π0.5与FastWAM也在VPP2训练数据所包含的全部ALOHA数据上微调。

    4.LIBERO-Pro:分布内高分真正转化为泛化

    VPP2在LIBERO-Pro上总体成功率达45.0%(VLA基线最高仅11.0%),在 LIBERO-OOD上达63.9%,同时超过专门为弥补该泛化差距设计的Temporal Ratio。

    5.RoboDojo:仿真基准双指标第一

    RoboDojo是一个统一的双臂仿真基准,含42个双臂任务、覆盖五个能力维度。VPP2取得39.26的平均得分与32.26%的成功率,超过包括GPT-6-Astra在内的全部对比方法。

    6.高层规划增益:与大模型完美配合

    团队在五个选定任务组上对比“是否采用基于VLM的子任务规划”(每任务50次试验)。接入规划后平均成功率从27.6%跃升至57.6%。

    Agentic system 2+WAM system 1极致推理和快速响应的配合

    VPP2的价值不止于刷新WAM的SOTA,更在于提供了一套忠实跟随语言快速响应的快系统,将语言指令忠实地映射到物理世界中。

    GPT代表“认知智能”,擅长语言理解、推理与规划,回答“做什么、为什么做”;但它没有物理世界的“身体”,不理解重力、碰撞、摩擦,也无法实时感知与闭环——会想,却不一定会做。VPP2补上的正是物理智能这一环:通过视频预测理解物理动力学,把高层指令转化为时序连贯、物理可行的动作轨迹,回答“怎么做、做得到”。

    GPT管“想”、VPP2管“做”:物理AI=通用认知×通用物理执行。未来,二者结合可形成“认知—规划—预测—执行—反馈”的完整闭环:GPT当作system2,把模糊目标拆解为子任务;VPP2当作system1,产生条件反射一般的快速响应,把子任务稳稳落地,真实数据再回流反哺两端。相关数据直接验证了这一点:接入VLM分层规划器后,某些任务平均成功率从27.6%跃升至57.6%。未来物理AI的完整能力范式=通用认知×通用物理执行,缺一不可。

    至此,星动纪元具身模型一年内连夺全球四榜冠军:

    技术的价值,最终要在真实场景兑现生产力。星动纪元是最早进入物流行业的具身机器人企业,已率先完成行业首个PMF验证:与中国邮政、顺丰合作,在全国 5 个省市、10 余个物流中心常态化运营,成果获外交部发言人、央视公开点赞——把WAM的技术优势变成了看得见、用得上的新质生产力。

    从斩获全球权威四榜冠军,到物流产线规模化上岗,星动纪元正沿着“预测得更好、行动得更好”的方向,向着“打造物理世界通用智能体,让机器人成为人类可靠伙伴”的愿景迈进。

    (新媒体责编:caizhuo)

    声明:

    1、凡本网注明“人民交通杂志”/人民交通网,所有自采新闻(含图片),如需授权转载应在授权范围内使用,并注明来源。

    2、部分内容转自其他媒体,转载目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责。

    3、如因作品内容、版权和其他问题需要同本网联系的,请在30日内进行。电话:010-67683008

    时政 | 交通 | 交警 | 公路 | 铁路 | 民航 | 物流 | 水运 | 汽车 | 财经 | 舆情 | 邮局

    人民交通24小时值班手机:17801261553 商务合作:010-67683008转602

    Copyright 人民交通杂志 All Rights Reserved 版权所有 复制必究 百度统计 地址:北京市丰台区南三环东路6号A座四层

    增值电信业务经营许可证号:京B2-20201704 本刊法律顾问:北京京师(兰州)律师事务所 李大伟

    京公网安备 11010602130064号 京ICP备18014261号-2  广播电视节目制作经营许可证:(京)字第16597号