DM0
可控场景下的具身基础模型
DM0 能够完成在可控环境下的一系列复杂动作任务的学习,验证了视觉、语言与动作统一建模的潜力。
把可控环境中的复杂动作学习,推进到开放环境中的稳定任务执行。
DM0 能够完成在可控环境下的一系列复杂动作任务的学习,验证了视觉、语言与动作统一建模的潜力。
一个通用机器人基础模型,不能只在固定场景完成既定的任务。
延续 VLA 架构,以 Gemma3 4B VLM 作为多模态主干,并配置 680M Action Expert 生成连续机器人动作。
通过引入历史帧,让模型可以通过短期情境记忆帮助决策。
在机器人数据中引入 11 种不同的自回归任务,在训练时同步强化指令遵循、动作预测和时序环境感知能力。
通过动态动作匹配,提升动作生成的平滑性、鲁棒性和跨采集员节奏泛化能力。
Zero-Shot 能力涌现、Fine-Tuning 高效可靠、长记忆能力、动作更加鲁棒、多机型支持。
为评估模型在未见任务配置下的 Zero-Shot 泛化能力,从动作类型和条件约束两个维度系统测试其任务执行表现。
使用 RoboChallenge Table30 v2 评测 DM0.5 的真实机器人桌面操作能力。
历史记忆能力用于衡量模型是否能够将过去观测整合为当前决策的上下文。
面对光照、相机视角变化以及人为干扰,DM0.5 仍能保持稳定可靠的策略执行表现。
实验结果表明,DM0.5 在大多数评测维度上均显著优于 PI05-Droid 和 DM0。
面向开放世界的能力建设中,DM0.5 不是把更多任务装进模型,而是让模型具备面对未知任务、未知场景和未知干扰的基础能力。
将记忆结果纳入当前决策,让机器人理解任务进程。
从固定任务表走向自然语言指令和开放条件组合。
在环境变化时,仍能继续完成任务。