五个能力维度
官方榜单口径:维度内任务等权,五维等权平均;generalization 的普通/随机版本各占一半。所以一个评测条件的杠杆(从 0 做到 100% 能给总分加几分)取决于它所在维度有几个条件——memory 每条 3.33 分,generalization 每条只有 0.83 分。两种统计:已完成子集(29 个基础任务全部测完,其他模型也按同一子集重算)和全量补零(未完成/异常/跳过项暂记 0 分)。参照线为官方榜首。"训练份额"是 robodojo_task_focus.yaml 草案里该维度可训任务的采样份额之和。
逐任务结果
点任意圆点看那条 episode 的头部相机录像(有录像的圆点带实心边)。每个任务最多带 3 条成功、2 条失败的录像。每张卡还标了:你的评审备注、该条件对总分的杠杆、训练语料覆盖情况和 robodojo_task_focus.yaml 草案里的采样权重。
成功
失败(圆点内为部分得分)
场景异常,隔离不计
未跑 / 跳过
重点可能可以提别管了 评审备注
训练任务随机布局变体未训练 语料覆盖