DM0.5

面向开放世界的通用具身智能基础模型

让机器人开始拥有更长的记忆、更开放的理解、更稳定的行动。

60s 最长历史记忆 10Hz 4090 单卡推理 20Hz H100 单卡推理 4B 参数量
DM0.5 面向开放世界,泛化涌现

从 DM0 到 DM0.5

把可控环境中的复杂动作学习,推进到开放环境中的稳定任务执行。

DM0

可控场景下的具身基础模型

DM0 能够完成在可控环境下的一系列复杂动作任务的学习,验证了视觉、语言与动作统一建模的潜力。

DM0.5

面向开放世界的通用具身智能基础模型

一个通用机器人基础模型,不能只在固定场景完成既定的任务。

了解 DM0.5 模型

延续 VLA 架构,以 Gemma3 4B VLM 作为多模态主干,并配置 680M Action Expert 生成连续机器人动作。

Context Abstraction Layer

历史信息融合

通过引入历史帧,让模型可以通过短期情境记忆帮助决策。

Embodiment CoT Tasks

广泛的具身推理

在机器人数据中引入 11 种不同的自回归任务,在训练时同步强化指令遵循、动作预测和时序环境感知能力。

Trajectory Alignment Layer

动态动作匹配

通过动态动作匹配,提升动作生成的平滑性、鲁棒性和跨采集员节奏泛化能力。

模型 Overview

DM0.5 核心优势

Zero-Shot 能力涌现、Fine-Tuning 高效可靠、长记忆能力、动作更加鲁棒、多机型支持。

为评估模型在未见任务配置下的 Zero-Shot 泛化能力,从动作类型和条件约束两个维度系统测试其任务执行表现。

  • 动作维度涵盖以下 8 类基础操作原语:pick、put、move、pull、cover、wipe、stack、press。
  • 条件维度包括颜色(color)、形状(shape)、尺寸(size)、状态(status)、执行序列(sequence)、相对位置(relative position)及绝对位置(absolute position)共 7 类语义约束。

更强的指令理解与动作执行能力

实验结果表明,DM0.5 在大多数评测维度上均显著优于 PI05-Droid 和 DM0。

Franka 各动作类别任务成功率
Franka 条件维度任务成功率
Dexmal Mirror 各动作类别任务成功率
Dexmal Mirror 条件维度任务成功率

让真实世界成为训练环境

面向开放世界的能力建设中,DM0.5 不是把更多任务装进模型,而是让模型具备面对未知任务、未知场景和未知干扰的基础能力。

更长的记忆

将记忆结果纳入当前决策,让机器人理解任务进程。

更开放的理解

从固定任务表走向自然语言指令和开放条件组合。

更稳定的行动

在环境变化时,仍能继续完成任务。