评测设置
下面所有数字都按这套设置跑。只有同一条管线、同一回合数口径下的数字才能直接比较。
一次全量评测:官方协议与 7/seed 筛查
- 54 个任务配置:官方 RoboDojo 仿真基准的全部配置(含 _random、_by_language 等变体),分属五个维度:泛化、精度、长程、记忆、开放。
- 官方协议(09-24 22:30 起的标准):seed 0、1、2,每个 seed 按官方
eval_nums跑 50 回合(24 个配置为 25 回合),全部 54 个配置共 6300 回合(EVAL_NUM=native)。要上榜或和别的模型比较,必须用这个。seed 决定物体摆放(layout),由官方 seed 管理器生成,我们没有改动。 - 7/seed 筛查:每个 seed 只跑 7 回合(
EVAL_NUM=7),每个配置 21 回合,全量 1134 回合,约为官方协议的 1/5.6,用来快速初筛。本页凡是 1134 回合(或 19 个任务 399 回合)的数字都是这种筛查,都标了"7/seed 筛查"。 - 误差:7/seed 筛查的全量总成功率标准误约 1 个百分点,两份结果相差 1–2 个百分点时分不出高下;单个配置只有 21 回合,误差约 ±8 个百分点。官方协议 6300 回合的总成功率标准误约 0.45 个百分点,单个配置(75 或 150 回合)约 ±3–4 个百分点。
- 成功率 = 完全成功的回合 / 总回合。Score = 官方原生得分(0–100,含部分完成)。离线排名按官方五维等权平均 Score 计算,把我们的一行插进官方榜单 2026.9.23 版,不是提交后的正式成绩。
WAM 推理设置(所有 WAM 评测相同)
- 纯 WAM 端到端:官方原始任务指令直接给 DO-WAM,没有 GPT 规划器,也不改写指令。
- 去噪 10 步,使用训练时保存的调度器(WAN shift 5);不用 CFG(guidance 关闭)。
- 每次预测 32 步动作,执行完再重新规划;控制频率 25 Hz,所以每 1.28 秒重新规划一次。
- 推理时 shared_timestep = true(训练时为 false)。
- 权重用 EMA,导出成 bf16 后评测。
- 早期评测(09-10 至 09-19)的设置和渲染不同,只作参考。
两条仿真管线
| 官方 Docker(现在的标准) | 补丁栈(09-23 以前) | |
|---|---|---|
| 仿真 | 官方镜像 robodojo:cuda12.8(上游 726e9aa,Isaac Sim 5.1),代码不改 | 我们自己的原生树(上游代码加补丁),跑在 exx 和 L40S 上 |
| 物理 | CPU(官方默认) | GPU + Fabric;传送带任务在 GPU 物理下带子不动,改用 CPU |
| 渲染 | 官方原样 | 修过几处渲染问题;早期 7 环境批量渲染会丢场景物体,后来改成单环境 |
| 同一权重的结果 | config_exp 60k:14.37% | config_exp 60k:15.88% |
| 资源 | 每组(1 个配置 × 1 个 seed)要跑 DO-WAM policy server 和 Isaac Sim 渲染(物理在 CPU 上,但相机渲染必须用 GPU)。09-24 21:16 以前两者各占一张卡,16 台节点最多 32 组并行,一份全量约 3 小时;之后两者共用一张卡(实测显存峰值 40–42 GB,卡为 45 GB),最多 64 组并行:7/seed 筛查约 1.5 小时,官方协议 6300 回合预计 8–9 小时。物理在 CPU 上,同一型号的卡,结果不受这个改动影响。 | |
09-23 起所有新评测只用官方 Docker 管线。物理引擎会改变逐任务分数,所以两条管线的数字不能混比。
各个权重是怎么来的
| 权重 | 训练 |
|---|---|
| config_exp 60k EMA | 276k EMA 初始化,在 RoboDojo 数据上微调 60000 步;cosine 学习率,峰值 1e-4;全局 batch 256;任务均匀采样 |
| skill_fix 40k EMA | 从 config_exp 60k 续训的 skill 模型,学习率 1e-5,mask_inactive_arms = false,第 40000 步 |
| skill30 w125 spell02 · 30k EMA | task70 / skill30 重加权数据,从 EMA 51k 初始化的 WSD-S 训练,第 30000 步 |
| focus_v2 60k / 120k EMA | 同样 276k 初始化;按 v2 任务权重采样,WSD-S 学习率;60k、120k 是两个衰减终点 |
| skill WSD-S 40k EMA(评测中) | Skill 20k EMA 起步,WSD-S 再训 20k 步;19 个 WAM 路由任务的数据权重 ×2 |
| config_exp WSD-S 65k EMA(排队中) | 从 config_exp 60k 完整训练状态续训 5000 步:WSD-S,峰值 1e-4,最后 1000 步衰减到 1e-6;6 个 memory 任务数据比例为 0;4 × H200,全局 batch 256 |
GPT-only 与组合路由
- GPT-only:GPT-6 Astra 规划 move_to、grip 等原语,由 IK 和 cuRobo 执行,不用 WAM。reasoning high,每回合最多 36 次调用、15 美元;只用 RGB,可以额外查询深度。
- GPT-only 只跑路由给 GPT 的 35 个配置,每个配置 layout 0、1、2 各一回合,比 WAM 的 21 回合少得多。
- 组合路由:按互补性报告把 19 个配置交给 WAM、35 个交给 GPT,再按官方五维等权合成一个分数。这是离线估算。详见 GPT-only 详情页。
全量 54 个任务(纯 WAM)
每一行是一份完整评测,都是 7/seed 筛查(每个配置 21 回合,共 1134 回合),不是官方协议的 6300 回合。横条长度是成功率,右侧是成功回合数与总回合数。只有同一管线分组内的数字可以直接比较。
横条满格是 35%,与下面两节共用一个刻度。离线排名只计完整评测,按官方五维等权平均 Score 计算。
19 个 WAM 路由任务
组合路由方案把 19 个任务交给 WAM、其余 35 个交给 GPT。这一节只看这 19 个任务,每份都是 399 回合(7/seed 筛查)。
GPT harness(GPT-only 与 GPT 调用 skill30)与组合路由估算
GPT-only 用 GPT-6 Astra 做规划,不用 WAM。它覆盖路由给 GPT 的 35 个任务配置,每个配置跑 layout 0、1、2 各一回合,seed 0。
组合路由估算(全部在官方 Docker 管线上)
| WAM 侧权重 | Score | 成功率 |
|---|---|---|
| config_exp 60k EMA | 41.3 | 33.8% |
| skill_fix 40k EMA | 39.3 | 31.4% |
| 官方榜首 Simate-beta | 34.0 | — |
这是离线估算,不是榜单成绩。GPT 侧每个配置只有 3 回合。早先报告用历史数字回推出的 57.89 在实测下不成立。
GPT 侧的短板
下面这些任务在两条管线上都是 0 分,而官方榜单上的 GPT-6 Astra 大多能拿 60 到 100 分:
- solve_equation、pour_by_language
- sort_nesting_dolls_by_size、push_T、make_kong
- imitate_sorting_sequence、sweep_blocks、pick_from_conveyor_by_image
差距多半来自我们的 harness 设置,例如只用 RGB、36 次调用上限和原语集。
进行中
L40S 队列状态,更新于 2026-09-25 02:30 UTC。都用官方 Docker 管线、全量 54 个配置 × 3 个 seed(162 组);回合数见每一行。21:16 起每组只占 1 张 GPU(policy server 与仿真共用一张卡),最多 64 组并行;之前是每组 2 张卡、32 组并行。
| 评测 | 状态 | 预计出结果 |
|---|---|---|
| skill WSD-S 40k EMA Skill 线:Skill 20k EMA 起步、WSD-S 再训 20k,19 个 WAM 路由任务权重 ×2。Codex 会话提交。 | 已完成(23:49 UTC,7/seed 筛查):162/162 组,134/1134 = 11.82%(官方 Docker)。同管线对照:config_exp 60k 14.37%,skill30 30k 13.40%,skill_fix 40k 11.73%。后 30 组每组 1 张 GPU | 已出 |
| config_exp WSD-S 第 1 周期 · 65k EMA 从 config_exp 60k 完整状态续训 5k 步(WSD-S,末 1k 步衰减),memory 任务比例为 0。 | 按官方协议重新提交(09-25 约 02:10 UTC,另一会话按用户要求):array 2731,162 组 × 每组 1 张 GPU,6300 回合,排在 skill30 + GPT 评测(2730)之后。之前 22:14 撤销的是 7/seed 筛查那次 | 待定 |