robodojo_s060000_ema_shared_d10_s3x7_20260911

RoboDojo DO-WAM 评测

主数字是 config_exp 60k EMA:从 276k EMA 预训练初始化,RoboDojo 上微调 60000 步。灰色参照是同样从 276k 初始化、换了任务采样权重和 WSD-S 调度的 focus_v2 60k,以及它的一次重跑(此前误标为 120k——那次 campaign 实际加载的是 60k 权重,两次结果之差就是同模型同 seed 的随机波动)。本页已更新为 L40S 补跑快照,剔除场景异常作废结果。历史 focus_v2 对比仍保留原快照。每个任务 3 个 seed × 7 条 episode(小样本,不是官方的 75/150 条全量评测);逐任务展示任务要求有效结果和可用的头部相机录像

五个能力维度

官方榜单口径:维度内任务等权,五维等权平均;generalization 的普通/随机版本各占一半。所以一个评测条件的杠杆(从 0 做到 100% 能给总分加几分)取决于它所在维度有几个条件——memory 每条 3.33 分,generalization 每条只有 0.83 分。两种统计:已完成子集按当前完整任务子集重算)和全量补零(未完成/异常/跳过项暂记 0 分)。参照线为官方榜首。"训练份额"是 robodojo_task_focus.yaml 草案里该维度可训任务的采样份额之和。

逐任务结果

点任意圆点看那条 episode 的头部相机录像(有录像的圆点带实心边)。每个任务最多带 3 条成功、2 条失败的录像。每张卡还标了:你的评审备注、该条件对总分的杠杆、训练语料覆盖情况和 robodojo_task_focus.yaml 草案里的采样权重。

成功 失败(圆点内为部分得分) 场景异常,隔离不计 尚无有效结果 重点可能可以提别管了 评审备注 训练任务随机布局变体未训练 语料覆盖

逐任务对照:官方榜单与 focus_v2

每行一个评测配置,数字都是成功率(%)。排名是本页 SR 在 40 个官方模型加我们共 41 个里的名次,按 SR 严格高于我们的模型数计,"并列"含我们自己。青色底表示本页 SR 不低于该任务官方榜首。点表头排序。我们每配置只有 21 条(1 次成功 ≈ 4.8 个点),官方是 75/150 条;差距在 ±10 点内基本看不出高低。

与公开榜单的离线对照

口径与限制

    剩余任务与数据说明