DFOL 2.0

世界模型驱动的具身后训练闭环

让 VLA 在更低成本、更高频反馈的闭环里完成 rollout、价值评估与策略更新,推动具身智能从数据复现走向持续优化。

让后训练形成闭环

从候选动作、未来反馈到策略更新持续回流。

DW05 作为训练环境

以世界模型替代高成本真机探索。

把未来转成 reward

用 Value Expert 输出可优化的价值信号。

降低真机占用

让有限 rollout 产生更高训练价值。

从 DFOL 1.0 到 DFOL 2.0

DFOL 2.0 将后训练的关键环节交给世界模型,让真机数据和训练成本同步下降。

DFOL 1.0

面向具身原生应用的量产工作流

Distributed Field Online Learning。

DFOL 2.0

世界模型驱动的后训练闭环

Dexmal Function Online Learning。

核心洞察:把世界模型当作仿真器,将 RL 搬进仿真环境中完成低成本、规模化的策略后训练。

60%真机后训练数据下降
40%训练成本下降

DFOL 2.0 世界模型驱动的后训练

世界模型当仿真器,把RL搬进仿真,实现低成本的规模化

DFOL 2.0 后训练框架:VLA 生成候选动作,DW05 世界模型产生 rollout 和 reward,RL 使用这些反馈更新策略

后训练闭环

  • 1. 采样候选动作VLA 根据语言指令、当前观察和机器人状态采样候选动作
  • 2. 世界模型 rolloutDW0.5 在动作条件下生成对应的未来视觉 rollout。
  • 3. 任务评分反馈Value Expert 对当前状态、候选未来或整段 rollout 给出成功概率或任务价值评分。
  • 4. 更新训练信号系统根据这些反馈选择动作、构造偏好数据,或对 VLA 做 RL 后训练。
  • 5. 真机持续校准少量真机 rollout 持续校准世界模型,让闭环不断贴近真实部署分布。

DFOL2.0 显著提升复杂真机任务性能

在打气球、叠纸盒、晾衣服三个复杂任务中,对比 SFT 展示训练成功率与子任务成功率提升。

Complex Task 01

打气球

包含夹起气球、夹起打气筒、气筒插入气球、给气球打气、打气筒归位等连续操作。

打气球任务训练成功率曲线
打气球任务 SFT 与 DFOL2.0 子任务对比图
Complex Task 02

叠纸盒

包含拿起纸板、叠右侧纸盒、叠左侧纸盒、纸盒放置纸箱等连续操作。

叠纸盒任务训练成功率曲线
叠纸盒任务 SFT 与 DFOL2.0 子任务对比图
Complex Task 03

晾衣服

包含夹起衣架、衣架塞入衣服、抓起衣角、挂起衣服、成功挂上衣架等连续操作。

晾衣服任务训练成功率曲线
晾衣服任务 SFT 与 DFOL2.0 子任务对比图