robodojo_s060000_ema_shared_d10_s3x7_20260911

RoboDojo DO-WAM 评测 · skill_fix 40k(官方 Docker)

← config_exp 60k EMA 最终结果页(补丁栈参照)

主数字是 skill_fix 40k EMA(DO-WAM-skill_wam,robodojo_skill_fix_nomask,H200 ×4,步 40000)的纯 WAM端到端结果,没有 GPT 规划器。全部 54 个任务 × 3 个 seed × 7 次都在官方 RoboDojo Docker 镜像(upstream 726e9aa,Isaac Sim 5.1,官方默认 CPU 物理,单环境)里评测,DO-WAM 策略服务器跑在宿主机,AWS L40S ×16 由 Slurm 调度。灰色参照:config_exp 60k EMA 的最终结果(打补丁的 exx 原生栈)以及 focus_v2 60k。每条 episode 都能看到任务要求结果头部相机录像,rollout 的动作序列也已保存。

管线说明(09-24):本页是首个用官方 Docker 镜像整套跑完的评测:原版上游代码、官方默认配置(CPU 物理、Fabric 关、单环境),无任何渲染补丁,因此不再需要逐条渲染核验。与 config_exp 60k 参照的差异同时包含 checkpoint 不同仿真管线不同(补丁栈 vs 官方 Docker),逐任务对照时请留意:play_tic_tac_toe、build_tower 等在官方管线下明显更低。上游 09-16/09-19 改过 stack_blocks_by_language 和 organize_table 的指令文本,这两个任务的文本 embedding 缓存已按新指令重算后补跑(AGENT.md §6 (h))。

五个能力维度

官方榜单口径:维度内任务等权,五维等权平均;generalization 的普通/随机版本各占一半。所以一个评测条件的杠杆(从 0 做到 100% 能给总分加几分)取决于它所在维度有几个条件——memory 每条 3.33 分,generalization 每条只有 0.83 分。两种统计:已完成子集(29 个基础任务全部测完,其他模型也按同一子集重算)和全量补零(未完成/异常/跳过项暂记 0 分)。参照线为官方榜首。"训练份额"是 robodojo_task_focus.yaml 草案里该维度可训任务的采样份额之和。

逐任务结果

点任意圆点看那条 episode 的头部相机录像(有录像的圆点带实心边)。每个任务最多带 3 条成功、2 条失败的录像。每张卡还标了:你的评审备注、该条件对总分的杠杆、训练语料覆盖情况和 robodojo_task_focus.yaml 草案里的采样权重。

成功 失败(圆点内为部分得分) 场景异常,隔离不计 未跑 / 跳过 重点可能可以提别管了 评审备注 训练任务随机布局变体未训练 语料覆盖

逐任务对照:官方榜单、config_exp 60k 与 focus_v2

每行一个评测配置,数字都是成功率(%)。排名是本页 SR 在 40 个官方模型加我们共 41 个里的名次,按 SR 严格高于我们的模型数计,"并列"含我们自己。青色底表示本页 SR 不低于该任务官方榜首。点表头排序。我们每配置只有 21 条(1 次成功 ≈ 4.8 个点),官方是 75/150 条;差距在 ±10 点内基本看不出高低。

官方榜单(RoboDojo Sim Leaderboard,官网 2026.9.23 版)与本页模型的位置

已测完子集上的重算排名(前 12)

官网榜单更新记录

口径与局限

    未计入的部分