DW05

世界模型驱动,从基模到应用

为 VLA 构建一个可闭环迭代的世界模型,让有限的真实机器人交互产生最大的训练价值

DW05 模型如何工作

DW05 以多模态输入建立具身世界表征,并通过 Video、Action、Value 三个 Expert 输出预测、动作和评估结果。

DW05 模型结构示意图:多模态输入进入 Generative Backbone,并由 Video、Action、Value Expert 输出视频、机器人动作和状态价值

离线数据增强与偏好构造

VLA 从数据集学习专家动作的同时,使用 DW0.5 对候选动作进行未来 rollout 和价值评估,自动构造偏好对、失败样本和恢复样本,形成可持续的训练数据。

RL 后训练环境

VLA 在 DW0.5 中采样动作序列,观察生成的未来视觉状态,并根据 Value Expert 的评分获得 reward 反馈,在不频繁占用真机的情况下进行低成本的大规模策略优化。

部署时规划与安全评估

在执行之前,系统对多个候选动作进行短视野 rollout,选择价值更高、风险更低的动作;一旦 Value Expert 判断当前状态偏离成功路径,立即触发重新规划。

WorldArena 等榜单第一名

WorldArena 榜单结果截图
E-WMBench 榜单结果截图

预测、行动、评估到真实任务闭环

DW05 覆盖指令生成、动作跟随、指令跟随、多步指令、泛化性、多视角一致性和任务进度评估。

围绕语言指令、动作片段和多步操作,生成可执行的任务过程。

指令跟随

根据语言指令生成对应操作过程。

动作跟随

保持动作演示中的操作节奏与关键步骤。

多步指令

面向连续子任务生成完整执行序列。