离线数据增强与偏好构造
VLA 从数据集学习专家动作的同时,使用 DW0.5 对候选动作进行未来 rollout 和价值评估,自动构造偏好对、失败样本和恢复样本,形成可持续的训练数据。
DW05 以多模态输入建立具身世界表征,并通过 Video、Action、Value 三个 Expert 输出预测、动作和评估结果。
VLA 从数据集学习专家动作的同时,使用 DW0.5 对候选动作进行未来 rollout 和价值评估,自动构造偏好对、失败样本和恢复样本,形成可持续的训练数据。
VLA 在 DW0.5 中采样动作序列,观察生成的未来视觉状态,并根据 Value Expert 的评分获得 reward 反馈,在不频繁占用真机的情况下进行低成本的大规模策略优化。
在执行之前,系统对多个候选动作进行短视野 rollout,选择价值更高、风险更低的动作;一旦 Value Expert 判断当前状态偏离成功路径,立即触发重新规划。


DW05 覆盖指令生成、动作跟随、指令跟随、多步指令、泛化性、多视角一致性和任务进度评估。
围绕语言指令、动作片段和多步操作,生成可执行的任务过程。
根据语言指令生成对应操作过程。
保持动作演示中的操作节奏与关键步骤。
面向连续子任务生成完整执行序列。
覆盖跨构型、跨环境和人类到机器人迁移等场景。
覆盖不同机器人构型下的任务泛化。
覆盖不同环境分布下的任务泛化。
面向人类动作到机器人操作的迁移场景。
在不同观察视角下保持任务状态与动作生成一致。
Front、Left、Right 三视角保持一致。
不同视角下保持任务状态一致。
多视角生成过程保持稳定一致。
通过成功与失败执行样本,展示 Value 信号对任务状态和成功路径的判断能力。