robodojo_s060000_ema_shared_d10_s3x7_20260911

RoboDojo DO-WAM 评测

主数字是 config_exp 60k EMA 的最终结果:从 276k EMA 预训练初始化、RoboDojo 上微调 60000 步。54 个任务 × 3 个 seed × 7 次。其中 43 个任务沿用 09-11 在 exx 上的结果;11 个任务(棋盘、存钱罐、木琴、工具箱、笔记本支架等在批量渲染下不可见)于 09-23 在 L40S 上按修正后的渲染配方重跑(单环境,Fabric Scene Delegate 关 + readTransformsFromFabric 关)。灰色参照:同一 checkpoint 09-11 的原始小样本结果,以及 focus_v2 60k。每条 episode 都能看到任务要求结果头部相机录像

管线说明(09-23):本页全部数字来自 exx/L40S 的补丁仿真栈(物理跑在 GPU + Fabric,官方默认是 CPU;已确认传送带任务在 GPU 管线下带子不动,两个传送带任务正用 CPU 管线补跑)。按决定,下一版将用官方 RoboDojo Docker 镜像(原版代码、官方默认配置)整套重跑 54 × 21,届时整页替换;当前页作为"补丁栈参照"保留。
渲染核验(09-23,逐条):批量渲染(7 环境)的旧结果会随机漏渲染任务物体、放错相机,且各 episode 不同。42 个沿用旧结果任务的全部 882 条首帧已逐条核过:32 个任务无误;10 个任务共 170 条无效(杯架 / 数字牌 / 垫片 / 托盘 / 鸡蛋篮 / 分类盒 / 目标 T 标记缺失,或传送带无物体)已全部用修正配方补跑并再次逐条核验(物体齐、亮度正常、有运动)。其中两个传送带任务的根因是 GPU 物理管线下传送带不运物体(`PhysxSurfaceVelocityAPI` 无效),改为官方默认的 CPU 物理管线后 match_and_pick_from_conveyor 从 0/21 变为 10/21;pick_from_conveyor_by_image 的 seed 1 一组(7 条)补跑失败,暂缺。无效/缺失的 episode 在卡片里标

五个能力维度

官方榜单口径:维度内任务等权,五维等权平均;generalization 的普通/随机版本各占一半。所以一个评测条件的杠杆(从 0 做到 100% 能给总分加几分)取决于它所在维度有几个条件——memory 每条 3.33 分,generalization 每条只有 0.83 分。两种统计:已完成子集(29 个基础任务全部测完,其他模型也按同一子集重算)和全量补零(未完成/异常/跳过项暂记 0 分)。参照线为官方榜首。"训练份额"是 robodojo_task_focus.yaml 草案里该维度可训任务的采样份额之和。

逐任务结果

点任意圆点看那条 episode 的头部相机录像(有录像的圆点带实心边)。每个任务最多带 3 条成功、2 条失败的录像。每张卡还标了:你的评审备注、该条件对总分的杠杆、训练语料覆盖情况和 robodojo_task_focus.yaml 草案里的采样权重。

成功 失败(圆点内为部分得分) 场景异常,隔离不计 未跑 / 跳过 重点可能可以提别管了 评审备注 训练任务随机布局变体未训练 语料覆盖

逐任务对照:官方榜单、09-11 原始结果与 focus_v2

每行一个评测配置,数字都是成功率(%)。排名是本页 SR 在 40 个官方模型加我们共 41 个里的名次,按 SR 严格高于我们的模型数计,"并列"含我们自己。青色底表示本页 SR 不低于该任务官方榜首。点表头排序。我们每配置只有 21 条(1 次成功 ≈ 4.8 个点),官方是 75/150 条;差距在 ±10 点内基本看不出高低。

官方榜单(RoboDojo Sim Leaderboard,官网 2026.9.23 版)与本页模型的位置

已测完子集上的重算排名(前 12)

官网榜单更新记录

口径与局限

    未计入的部分