checkpoint 来历
本站评测过的每个权重都从同一个 276k 预训练底座出发。每个方框写的是这一步做了什么训练,下方标签是它在本站的评测结果(可点击进入详情);灰底方框是只作为中间起点、本身没有单独评测的权重。来源:各 checkpoint 目录里的 CKPT.md 与 train_config.yaml(/mnt/efs/monitor/ckpts)。
- 276k EMA · 预训练底座c288_step_276000_ema:LTX-2.3 视频模型基础上预训练的 DO-WAM 通用底座,下面所有权重都从它出发
- config_exp(RoboDojo 微调)276k EMA 初始化,在 RoboDojo 全部 54 个任务的数据上微调 60000 步;cosine 学习率,峰值 1e-4,warmup 3000;全局 batch 256;任务均匀采样;16 节点。原生 eef20 端到端策略
- config_exp 51k EMA这次微调第 51000 步的 EMA,只作为下面 skill30 的起点,本身没有单独评测
- skill30 w125 spell02 · 30k EMA从 51k EMA 只加载权重(不接优化器状态);数据改为 task 70% / skill 30% 混合,19 个 WAM 路由任务权重 1.25、原来 5 个任务 0.33、spell 0.2、其余 1.0;WSD-S 学习率,峰值 1e-4,每 5000 步一个周期(最后 1000 步衰减);本页是第 30000 步
- config_exp 60k EMA微调结束(第 60000 步)的 EMA。目前纯 WAM 最好的权重,也是下面四条分支的共同起点
- config_exp WSD-S 第 1 周期 · 65k EMA接 60k 的完整训练状态(含优化器)续训 5000 步:WSD-S,峰值 1e-4,最后 1000 步线性衰减到 1e-6;6 个 memory 任务的数据比例设为 0;4 × H200
- skill_fix(skill 模型)以 60k EMA 为初始化,改训 skill 模型:技能指令数据按技能概率采样,mask_inactive_arms = false;学习率 action 1e-5 / video 1e-6,cosine,计划 100000 步;4 × H200,全局 batch 256
- skill_fix 74.5k EMA09-23 在第 74500 步停止训练时的权重未评测
- skill_fix 20k EMA第 20000 步的 EMA,作为 Junbo 下面这条分支的起点
- Junbo · skill WSD-S WAM19×2从 skill_fix 20k EMA 起步,WSD-S 学习率峰值 5e-5,每 2500 步一个周期(最后 500 步衰减);训练 1500 步后改成把 19 个 WAM 路由任务的数据权重 ×2 接着训。步数按 skill 线累计(20k + 本段步数)
- 累计 40k EMA(本段第 20000 步)
- 累计 53k EMA(本段第 33000 步)官方协议评测 09-25 按要求暂停,无结果
- skill(Ziming 的 skill 100k)以 60k EMA 为初始化的另一条 skill 模型训练:学习率 1e-5,cosine 100000 步,16 × H100;中途因故障断点续训几次,是同一条训练88.5k:Junbo 提示词路由实验98k / 100k:RPent 技能调用评测不在本站
- focus_v2(Ziming)同样从 276k EMA 起步,沿用 config_exp 的配方,但按 v2 任务权重采样;WSD-S 学习率,每 20000 步一个衰减点(最后 4000 步衰减到 1e-6);16 × H100,训练到 129.8k 时停止60k · 旧补丁栈 12.2%(1050 回合)“120k”评测无效:实际加载的是 60k 权重
- Junbo · skill cos276kskill 模型直接从 276k EMA 起步(不经过 config_exp):cosine 60000 步,学习率 action 1e-4 / video 1e-5,19 个 WAM 路由任务 ×2;8 × H20028.5k:7/seed 筛查 09-25 按要求撤销,无结果
评测设置
下面所有数字都按这套设置跑。只有同一条管线、同一回合数口径下的数字才能直接比较。
一次全量评测:官方协议与 7/seed 筛查
- 54 个任务配置:官方 RoboDojo 仿真基准的全部配置(含 _random、_by_language 等变体),分属五个维度:泛化、精度、长程、记忆、开放。
- 官方协议(09-24 22:30 起的标准):seed 0、1、2,每个 seed 按官方
eval_nums跑 50 回合(24 个配置为 25 回合),全部 54 个配置共 6300 回合(EVAL_NUM=native)。要上榜或和别的模型比较,必须用这个。seed 决定物体摆放(layout),由官方 seed 管理器生成,我们没有改动。 - 7/seed 筛查:每个 seed 只跑 7 回合(
EVAL_NUM=7),每个配置 21 回合,全量 1134 回合,约为官方协议的 1/5.6,用来快速初筛。本页凡是 1134 回合(或 19 个任务 399 回合)的数字都是这种筛查,都标了"7/seed 筛查"。 - 误差:7/seed 筛查的全量总成功率标准误约 1 个百分点,两份结果相差 1–2 个百分点时分不出高下;单个配置只有 21 回合,误差约 ±8 个百分点。官方协议 6300 回合的总成功率标准误约 0.45 个百分点,单个配置(75 或 150 回合)约 ±3–4 个百分点。
- 成功率 = 完全成功的回合 / 总回合。Score = 官方原生得分(0–100,含部分完成)。离线排名按官方五维等权平均 Score 计算,把我们的一行插进官方榜单 2026.9.23 版,不是提交后的正式成绩。
WAM 推理设置(所有 WAM 评测相同)
- 纯 WAM 端到端:官方原始任务指令直接给 DO-WAM,没有 GPT 规划器,也不改写指令。
- 去噪 10 步,使用训练时保存的调度器(WAN shift 5);不用 CFG(guidance 关闭)。
- 每次预测 32 步动作,执行完再重新规划;控制频率 25 Hz,所以每 1.28 秒重新规划一次。
- 推理时 shared_timestep = true(训练时为 false)。
- 权重用 EMA,导出成 bf16 后评测。
- 早期评测(09-10 至 09-19)的设置和渲染不同,只作参考。
两条仿真管线
| 官方 Docker(现在的标准) | 补丁栈(09-23 以前) | |
|---|---|---|
| 仿真 | 官方镜像 robodojo:cuda12.8(上游 726e9aa,Isaac Sim 5.1),代码不改 | 我们自己的原生树(上游代码加补丁),跑在 exx 和 L40S 上 |
| 物理 | CPU(官方默认) | GPU + Fabric;传送带任务在 GPU 物理下带子不动,改用 CPU |
| 渲染 | 官方原样 | 修过几处渲染问题;早期 7 环境批量渲染会丢场景物体,后来改成单环境 |
| 同一权重的结果 | config_exp 60k:14.37% | config_exp 60k:15.88% |
| 资源 | 每组(1 个配置 × 1 个 seed)要跑 DO-WAM policy server 和 Isaac Sim 渲染(物理在 CPU 上,但相机渲染必须用 GPU)。09-24 21:16 以前两者各占一张卡,16 台节点最多 32 组并行,一份全量约 3 小时;之后两者共用一张卡(实测显存峰值 40–42 GB,卡为 45 GB),最多 64 组并行:7/seed 筛查约 1.5 小时,官方协议 6300 回合预计 8–9 小时。物理在 CPU 上,同一型号的卡,结果不受这个改动影响。 | |
09-23 起所有新评测只用官方 Docker 管线。物理引擎会改变逐任务分数,所以两条管线的数字不能混比。
各个权重是怎么来的
见页面顶部的 checkpoint 来历:每个权重从 276k 出发经过了哪些训练、在本站的结果。
GPT-only 与组合路由
- GPT-only:GPT-6 Astra 规划 move_to、grip 等原语,由 IK 和 cuRobo 执行,不用 WAM。reasoning high,每回合最多 36 次调用、15 美元;只用 RGB,可以额外查询深度。
- GPT-only 只跑路由给 GPT 的 35 个配置,每个配置 layout 0、1、2 各一回合,比 WAM 的 21 回合少得多。
- 组合路由:按互补性报告把 19 个配置交给 WAM、35 个交给 GPT,再按官方五维等权合成一个分数。这是离线估算。详见 GPT-only 详情页。
官方协议(6300 回合,纯 WAM)
54 个配置 × seed 0–2 × 官方回合数(每个 seed 50 回合,其中 24 个配置 25 回合),与官方排行榜同一协议。总成功率的标准误约 0.4 个百分点;下面 7/seed 筛查的数字(1134 回合)误差约 1 个百分点,两者不要逐任务直接比。
全量 54 个任务(纯 WAM)
每一行是一份完整评测,都是 7/seed 筛查(每个配置 21 回合,共 1134 回合),不是官方协议的 6300 回合。横条长度是成功率,右侧是成功回合数与总回合数。只有同一管线分组内的数字可以直接比较。
横条满格是 35%,与下面两节共用一个刻度。离线排名只计完整评测,按官方五维等权平均 Score 计算。
19 个 WAM 路由任务
组合路由方案把 19 个任务交给 WAM、其余 35 个交给 GPT。这一节只看这 19 个任务,每份都是 399 回合(7/seed 筛查)。
GPT harness(GPT-only 与 GPT 调用 skill30)与组合路由估算
GPT-only 用 GPT-6 Astra 做规划,不用 WAM。它覆盖路由给 GPT 的 35 个任务配置,每个配置跑 layout 0、1、2 各一回合,seed 0。
组合路由估算(全部在官方 Docker 管线上)
| WAM 侧权重 | Score | 成功率 |
|---|---|---|
| config_exp 60k EMA | 41.3 | 33.8% |
| skill_fix 40k EMA | 39.3 | 31.4% |
| 官方榜首 Simate-beta | 34.0 | — |
这是离线估算,不是榜单成绩。GPT 侧每个配置只有 3 回合。早先报告用历史数字回推出的 57.89 在实测下不成立。
GPT 侧的短板
下面这些任务在两条管线上都是 0 分,而官方榜单上的 GPT-6 Astra 大多能拿 60 到 100 分:
- solve_equation、pour_by_language
- sort_nesting_dolls_by_size、push_T、make_kong
- imitate_sorting_sequence、sweep_blocks、pick_from_conveyor_by_image
差距多半来自我们的 harness 设置,例如只用 RGB、36 次调用上限和原语集。
进行中
L40S 队列状态,更新于 2026-09-25 02:30 UTC。都用官方 Docker 管线、全量 54 个配置 × 3 个 seed(162 组);回合数见每一行。21:16 起每组只占 1 张 GPU(policy server 与仿真共用一张卡),最多 64 组并行;之前是每组 2 张卡、32 组并行。
| 评测 | 状态 | 预计出结果 |
|---|---|---|
| skill WSD-S 40k EMA Skill 线:Skill 20k EMA 起步、WSD-S 再训 20k,19 个 WAM 路由任务权重 ×2。Codex 会话提交。 | 已完成(23:49 UTC,7/seed 筛查):162/162 组,134/1134 = 11.82%(官方 Docker)。同管线对照:config_exp 60k 14.37%,skill30 30k 13.40%,skill_fix 40k 11.73%。后 30 组每组 1 张 GPU | 已出 |
| config_exp WSD-S 第 1 周期 · 65k EMA 从 config_exp 60k 完整状态续训 5k 步(WSD-S,末 1k 步衰减),memory 任务比例为 0。 | 已完成(官方协议):162/162 组,906/6300 = 14.38%,Score 20.73 排第 6。 详情 → | 已出 |