让后训练形成闭环
从候选动作、未来反馈到策略更新持续回流。
从候选动作、未来反馈到策略更新持续回流。
以世界模型替代高成本真机探索。
用 Value Expert 输出可优化的价值信号。
让有限 rollout 产生更高训练价值。
DFOL 2.0 将后训练的关键环节交给世界模型,让真机数据和训练成本同步下降。
Distributed Field Online Learning。
Dexmal Function Online Learning。
核心洞察:把世界模型当作仿真器,将 RL 搬进仿真环境中完成低成本、规模化的策略后训练。
世界模型当仿真器,把RL搬进仿真,实现低成本的规模化
在打气球、叠纸盒、晾衣服三个复杂任务中,对比 SFT 展示训练成功率与子任务成功率提升。
包含夹起气球、夹起打气筒、气筒插入气球、给气球打气、打气筒归位等连续操作。


包含拿起纸板、叠右侧纸盒、叠左侧纸盒、纸盒放置纸箱等连续操作。


包含夹起衣架、衣架塞入衣服、抓起衣角、挂起衣服、成功挂上衣架等连续操作。

