DO-WAM · RoboDojo 仿真基准 · 更新于 2026-09-24 20:40 UTC

RoboDojo 评测总览

这里汇总 DO-WAM 在 RoboDojo 上的全部评测。官方协议是 54 个任务配置 × 3 个 seed × 官方回合数(每个 seed 50 回合,其中 24 个配置 25 回合),共 6300 回合;09-24 22:30 起正式结果都按官方协议跑。本页目前的全量数字都是每个 seed 7 回合的快速筛查(7/seed 筛查,1134 回合),官方协议的结果出来后会单独列出。离线排名对照官方榜单 2026.9.23 版(48 个模型,加上我们一共 49 行)。有详情页的结果可以点进去看逐任务数据和每一回合的录像。评测怎么跑、各个权重是什么,见下方评测设置。

最好的全量结果 · 7/seed 筛查

15.88%

config_exp 60k EMA,补丁栈(GPU 物理),离线排名第 6

同一权重 · 官方 Docker · 7/seed 筛查

14.37%

官方镜像、CPU 物理,Score 排名第 6

19 个 WAM 路由任务 · 7/seed 筛查

29.32%

config_exp 60k 独立重跑,与全量中同样 19 个任务的 29.07% 吻合

组合路由估算

41.3

19 个 WAM 任务 + 35 个 GPT 任务的 Score,官方榜首为 34.0

最新 · 09-25 · 第一份官方协议结果(6300 回合)· config_exp WSD-S 65k EMA,纯 WAM

14.38%

906 / 6300 回合成功;按官方排行榜算法 Score 20.73,48 个模型中排第 6(成功率第 8)。起点 60k 的 7/seed 筛查为 14.37%,续训 5k 步整体持平。点此看逐任务结果和每一回合的录像 →

最新 · 09-25 · GPT 调用 skill30(35 个 GPT 路由配置,官方 Docker)

30.5%

32 / 105 回合成功;同样配置 GPT-only 为 34.3%。平均每回合 15.3 美元。点此看逐任务结果、每一回合的录像和 GPT 每一步的操作 →

checkpoint 来历

本站评测过的每个权重都从同一个 276k 预训练底座出发。每个方框写的是这一步做了什么训练,下方标签是它在本站的评测结果(可点击进入详情);灰底方框是只作为中间起点、本身没有单独评测的权重。来源:各 checkpoint 目录里的 CKPT.md 与 train_config.yaml(/mnt/efs/monitor/ckpts)。

评测设置

下面所有数字都按这套设置跑。只有同一条管线、同一回合数口径下的数字才能直接比较。

一次全量评测:官方协议与 7/seed 筛查

  • 54 个任务配置:官方 RoboDojo 仿真基准的全部配置(含 _random、_by_language 等变体),分属五个维度:泛化、精度、长程、记忆、开放。
  • 官方协议(09-24 22:30 起的标准):seed 0、1、2,每个 seed 按官方 eval_nums 跑 50 回合(24 个配置为 25 回合),全部 54 个配置共 6300 回合(EVAL_NUM=native)。要上榜或和别的模型比较,必须用这个。seed 决定物体摆放(layout),由官方 seed 管理器生成,我们没有改动。
  • 7/seed 筛查:每个 seed 只跑 7 回合(EVAL_NUM=7),每个配置 21 回合,全量 1134 回合,约为官方协议的 1/5.6,用来快速初筛。本页凡是 1134 回合(或 19 个任务 399 回合)的数字都是这种筛查,都标了"7/seed 筛查"。
  • 误差:7/seed 筛查的全量总成功率标准误约 1 个百分点,两份结果相差 1–2 个百分点时分不出高下;单个配置只有 21 回合,误差约 ±8 个百分点。官方协议 6300 回合的总成功率标准误约 0.45 个百分点,单个配置(75 或 150 回合)约 ±3–4 个百分点。
  • 成功率 = 完全成功的回合 / 总回合。Score = 官方原生得分(0–100,含部分完成)。离线排名按官方五维等权平均 Score 计算,把我们的一行插进官方榜单 2026.9.23 版,不是提交后的正式成绩。

WAM 推理设置(所有 WAM 评测相同)

  • 纯 WAM 端到端:官方原始任务指令直接给 DO-WAM,没有 GPT 规划器,也不改写指令。
  • 去噪 10 步,使用训练时保存的调度器(WAN shift 5);不用 CFG(guidance 关闭)。
  • 每次预测 32 步动作,执行完再重新规划;控制频率 25 Hz,所以每 1.28 秒重新规划一次。
  • 推理时 shared_timestep = true(训练时为 false)。
  • 权重用 EMA,导出成 bf16 后评测。
  • 早期评测(09-10 至 09-19)的设置和渲染不同,只作参考。

两条仿真管线

官方 Docker(现在的标准)补丁栈(09-23 以前)
仿真官方镜像 robodojo:cuda12.8(上游 726e9aa,Isaac Sim 5.1),代码不改我们自己的原生树(上游代码加补丁),跑在 exx 和 L40S 上
物理CPU(官方默认)GPU + Fabric;传送带任务在 GPU 物理下带子不动,改用 CPU
渲染官方原样修过几处渲染问题;早期 7 环境批量渲染会丢场景物体,后来改成单环境
同一权重的结果config_exp 60k:14.37%config_exp 60k:15.88%
资源每组(1 个配置 × 1 个 seed)要跑 DO-WAM policy server 和 Isaac Sim 渲染(物理在 CPU 上,但相机渲染必须用 GPU)。09-24 21:16 以前两者各占一张卡,16 台节点最多 32 组并行,一份全量约 3 小时;之后两者共用一张卡(实测显存峰值 40–42 GB,卡为 45 GB),最多 64 组并行:7/seed 筛查约 1.5 小时,官方协议 6300 回合预计 8–9 小时。物理在 CPU 上,同一型号的卡,结果不受这个改动影响。

09-23 起所有新评测只用官方 Docker 管线。物理引擎会改变逐任务分数,所以两条管线的数字不能混比。

各个权重是怎么来的

见页面顶部的 checkpoint 来历:每个权重从 276k 出发经过了哪些训练、在本站的结果。

GPT-only 与组合路由

  • GPT-only:GPT-6 Astra 规划 move_to、grip 等原语,由 IK 和 cuRobo 执行,不用 WAM。reasoning high,每回合最多 36 次调用、15 美元;只用 RGB,可以额外查询深度。
  • GPT-only 只跑路由给 GPT 的 35 个配置,每个配置 layout 0、1、2 各一回合,比 WAM 的 21 回合少得多。
  • 组合路由:按互补性报告把 19 个配置交给 WAM、35 个交给 GPT,再按官方五维等权合成一个分数。这是离线估算。详见 GPT-only 详情页。

官方协议(6300 回合,纯 WAM)

54 个配置 × seed 0–2 × 官方回合数(每个 seed 50 回合,其中 24 个配置 25 回合),与官方排行榜同一协议。总成功率的标准误约 0.4 个百分点;下面 7/seed 筛查的数字(1134 回合)误差约 1 个百分点,两者不要逐任务直接比。

官方 Docker 管线 · robodojo:cuda12.8(上游 726e9aa)· CPU 物理 · 单环境
config_exp WSD-S c1 · 65k EMA官方协议
14.38%906 / 6300 · 第 6

全量 54 个任务(纯 WAM)

每一行是一份完整评测,都是 7/seed 筛查(每个配置 21 回合,共 1134 回合),不是官方协议的 6300 回合。横条长度是成功率,右侧是成功回合数与总回合数。只有同一管线分组内的数字可以直接比较。

官方 Docker 管线 · robodojo:cuda12.8(上游 726e9aa)· CPU 物理 · 单环境
config_exp 60k EMA最好
14.37%163 / 1134 · 第 6
skill30 w125 spell02 · 30k EMA
13.40%152 / 1134 · 第 8
skill WSD-S 40k EMA(Junbo)
09-24 · WAM19 权重 ×2 · 详情与录像 →
11.82%134 / 1134 · 第 9
skill_fix 40k EMA
11.73%133 / 1134 · 第 9
补丁仿真栈 · GPU 物理 + Fabric · 渲染修复
config_exp 60k EMA · 最终版
09-22 至 09-23 · 详情与录像 →
15.88%179 / 1127 · 第 6
早期评测 · 部分完成或旧设置,仅作参考
config_exp 60k EMA · 首轮
09-11 · 完成 133/162 组
15.15%141 / 931
45k EMA · 不用 CFG
09-10 · 完成 42/54 个配置
13.10%33 / 252
focus_v2 120k EMA
09-19 · 完成 150/162 组
12.48%131 / 1050
focus_v2 60k EMA
09-18 · 完成 150/162 组
12.19%128 / 1050

横条满格是 35%,与下面两节共用一个刻度。离线排名只计完整评测,按官方五维等权平均 Score 计算。

19 个 WAM 路由任务

组合路由方案把 19 个任务交给 WAM、其余 35 个交给 GPT。这一节只看这 19 个任务,每份都是 399 回合(7/seed 筛查)。

config_exp 60k EMA · 独立重跑
官方 Docker · 09-24
29.32%117 / 399
config_exp 60k EMA · 全量中的子集
官方 Docker · 详情 →
29.07%116 / 399
config_exp 60k EMA · 补丁栈中的子集
GPU 物理 · 详情 →
27.82%111 / 399
skill30 30k EMA · 全量中的子集
官方 Docker · 训练时加权 1.25 · 详情 →
26.82%107 / 399
skill WSD-S 40k EMA(Junbo)· 全量中的子集
官方 Docker · 训练时加权 ×2 · 详情 →
24.56%98 / 399
skill_fix 40k EMA · 全量中的子集
官方 Docker · 详情 →
24.31%97 / 399

GPT harness(GPT-only 与 GPT 调用 skill30)与组合路由估算

GPT-only 用 GPT-6 Astra 做规划,不用 WAM。它覆盖路由给 GPT 的 35 个任务配置,每个配置跑 layout 0、1、2 各一回合,seed 0。

GPT 调用 skill30 · 官方 Docker
GPT-6 Astra 以技能指令调用 skill30 30k · 详情、逐轮操作与录像 →
30.5%32 / 105
GPT-only · 官方 Docker
CPU 物理 · 35 个配置全部可跑 · 详情与录像 →
34.3%36 / 105
GPT-only · 补丁栈
GPU 物理 · 33 个配置可跑 · 详情与录像 →
34.3%34 / 99

组合路由估算(全部在官方 Docker 管线上)

WAM 侧权重Score成功率
config_exp 60k EMA41.333.8%
skill_fix 40k EMA39.331.4%
官方榜首 Simate-beta34.0—

这是离线估算,不是榜单成绩。GPT 侧每个配置只有 3 回合。早先报告用历史数字回推出的 57.89 在实测下不成立。

GPT 侧的短板

下面这些任务在两条管线上都是 0 分,而官方榜单上的 GPT-6 Astra 大多能拿 60 到 100 分:

  • solve_equation、pour_by_language
  • sort_nesting_dolls_by_size、push_T、make_kong
  • imitate_sorting_sequence、sweep_blocks、pick_from_conveyor_by_image

差距多半来自我们的 harness 设置,例如只用 RGB、36 次调用上限和原语集。

进行中

L40S 队列状态,更新于 2026-09-25 02:30 UTC。都用官方 Docker 管线、全量 54 个配置 × 3 个 seed(162 组);回合数见每一行。21:16 起每组只占 1 张 GPU(policy server 与仿真共用一张卡),最多 64 组并行;之前是每组 2 张卡、32 组并行。

评测状态预计出结果
skill WSD-S 40k EMA
Skill 线:Skill 20k EMA 起步、WSD-S 再训 20k,19 个 WAM 路由任务权重 ×2。Codex 会话提交。
已完成(23:49 UTC,7/seed 筛查):162/162 组,134/1134 = 11.82%(官方 Docker)。同管线对照:config_exp 60k 14.37%,skill30 30k 13.40%,skill_fix 40k 11.73%。后 30 组每组 1 张 GPU已出
config_exp WSD-S 第 1 周期 · 65k EMA
从 config_exp 60k 完整状态续训 5k 步(WSD-S,末 1k 步衰减),memory 任务比例为 0。
已完成(官方协议):162/162 组,906/6300 = 14.38%,Score 20.73 排第 6。 详情 →已出