skill_wsds_wam19x2_c040000_native_docker_20260924T182821Z

RoboDojo DO-WAM 评测 · Junbo skill WSD-S WAM19×2 40k(官方 Docker · CPU 物理)

← 评测总览 · config_exp 60k(官方 Docker) · skill_fix 40k(官方 Docker) · skill30 30k(官方 Docker) · config_exp 65k(官方协议)

主数字是 Junbo 的 skill WSD-S WAM19×2 · 累计 40k EMA(Skill 线:从 Skill 20k EMA 起步,WSD-S 再训 20k 步;组合路由里分给 WAM 的 19 个任务数据权重 ×2)在官方 RoboDojo Docker 镜像(upstream 726e9aa,Isaac Sim 5.1,官方默认 CPU 物理,单环境)里的纯 WAM全量结果,7/seed 筛查:54 × 3 × 7 = 1134 集(单个配置 21 回合,误差约 ±8 个百分点)。灰色参照一:config_exp 60k(同一 Docker 管线,目前最好的筛查结果);灰色参照二:skill_fix 40k(同一管线、同一 skill 线的旧 checkpoint)。评测由 Junbo 的 Codex 会话于 09-24 提交;每条 episode 都能看到任务要求、结果和头部相机录像。

结论(09-24 评测,09-25 上页):加权没有带来提升。134/1134 = 11.8%,按官方排行榜算法 Score 17.18,在 48 个模型中排第 9;同管线 config_exp 60k 14.4%(Score 第 6),skill30 30k 13.4%,skill_fix 40k 11.7%。被加权 ×2 的 19 个 WAM 路由任务合计 98/399 = 24.6%,低于 config_exp 60k 的 116/399 = 29.1%,与 skill_fix 40k 的 97/399 持平;其余 35 个任务 36/735 = 4.9%(60k 为 6.4%)。与 60k 相比 12 个配置变好、16 个变差、26 个持平;明显变差:make_kong 6 → 0/21、pour_liquid_into_cup 11 → 5/21、fasten_screws 6 → 2/21、plug_in_charger 5 → 1/21;变好:build_tower 6 → 8/21、fold_clothes 7 → 9/21、match_and_pick_from_conveyor 5 → 7/21。同一训练的更晚 checkpoint(累计 53k)的官方协议评测(6300 回合)已准备好,09-25 按要求暂停,尚无结果。

五个能力维度

官方榜单口径:维度内任务等权,五维等权平均;generalization 的普通/随机版本各占一半。所以一个评测条件的杠杆(从 0 做到 100% 能给总分加几分)取决于它所在维度有几个条件——memory 每条 3.33 分,generalization 每条只有 0.83 分。两种统计:已完成子集(29 个基础任务全部测完,其他模型也按同一子集重算)和全量补零(未完成/异常/跳过项暂记 0 分)。参照线为官方榜首。"训练份额"是 robodojo_task_focus.yaml 草案里该维度可训任务的采样份额之和。

逐任务结果

点任意圆点看那条 episode 的头部相机录像(有录像的圆点带实心边)。每个任务最多带 3 条成功、2 条失败的录像。每张卡还标了:你的评审备注、该条件对总分的杠杆、训练语料覆盖情况和 robodojo_task_focus.yaml 草案里的采样权重。

成功 失败(圆点内为部分得分) 场景异常,隔离不计 未跑 / 跳过 重点可能可以提别管了 评审备注 训练任务随机布局变体未训练 语料覆盖

逐任务对照:官方榜单、补丁栈(GPU 物理)与 skill_fix 40k(同管线)

每行一个评测配置,数字都是成功率(%)。排名是本页 SR 在 40 个官方模型加我们共 41 个里的名次,按 SR 严格高于我们的模型数计,"并列"含我们自己。青色底表示本页 SR 不低于该任务官方榜首。点表头排序。我们每配置只有 21 条(1 次成功 ≈ 4.8 个点),官方是 75/150 条;差距在 ±10 点内基本看不出高低。

官方榜单(RoboDojo Sim Leaderboard,官网 2026.9.23 版)与本页模型的位置

已测完子集上的重算排名(前 12)

官网榜单更新记录

口径与局限

    未计入的部分