← 评测总览

DO-WAM · RoboDojo 仿真基准 · GPT-only harness · 09-24 · 快速筛查(非官方协议)

GPT-only harness:35 个 GPT 路由配置

GPT-6 Astra 直接规划 move_to / grip / home / wait 等原语,由原生 IK 与 cuRobo 执行,完全不用 WAM。 覆盖组合路由方案里交给 GPT 的 35 个任务配置,每个配置跑 layout 0、1、2 各一回合(seed = layout),同一套设置跑了两条管线。

这是快速筛查,不是官方协议的结果。每个配置只有 3 回合;harness 用的是我们自己的设置(--protocol harness:只用 RGB 加深度查询、每回合最多 36 次调用),不是官方 GPT-6 Astra 协议(--protocol official)。09-24 22:30 起正式结果都要按官方协议跑(seed 0–2 × 官方回合数),这里的数字只用来初筛。

官方 Docker · CPU 物理 · 筛查

34.3%

36 / 105 回合成功,35 个配置全部可跑

补丁栈 · GPU 物理 · 筛查

34.3%

34 / 99 回合成功,布料和流体配置跑不起来

平均原生 Score

40.2

官方 Docker;补丁栈为 40.7

组合路由估算 · 筛查

41.3

19 个 WAM 任务 + 这 35 个 GPT 任务;官方榜首 34.0

逐任务结果

每个方块是一回合:实心 = 成功,空心 = 失败,虚线 = 没有得分。点方块看这一回合的头部相机录像、任务指令、调用次数和费用。 点表头可以排序。WAM 两列是同一官方 Docker 管线下 21 回合的结果,官方 Astra 是官方榜单上 GPT-6 Astra 的 Score。

配置 官方 DockerScore 补丁栈Score 官方 Astra WAM config_exp 60kWAM skill_fix 40k 平均调用费用
成功失败 没有得分调用次数和费用均为官方 Docker 一侧、每回合平均

组合路由估算

19 个任务交给 WAM、35 个交给 GPT,全部取官方 Docker 管线的数字,按官方五维等权平均。这是离线估算,不是榜单成绩: GPT 侧每个配置只有 3 回合,WAM 侧是 7/seed 筛查。

WAM 侧权重Score成功率泛化精度长程记忆开放
config_exp 60k EMA41.333.8%40.734.934.561.135.6
skill_fix 40k EMA39.331.4%40.426.633.061.135.6
官方榜首 Simate-beta34.0

组合方案的价值几乎全部来自 GPT 侧的 memory 维(cover_blocks、swap_blocks、match_and_pick、press_by_number)和 stack / arrange / pickup 类任务。早先报告用历史数字回推出的 57.89 在实测下不成立。

设置

harness

  • do_harness = Rpent skill-hybrid-20260921 @ 0cfaffc(加 init-shim 修复)
  • GPT-6 Astra,reasoning high;每回合最多 36 次调用、15 美元
  • 感知:只用 RGB,可以额外查询深度;运动:cuRobo
  • 原始任务指令,没有 WAM,没有 policy server

两条管线

  • 官方 Docker:官方镜像 robodojo:cuda12.8(upstream 726e9aa),CPU 物理,单环境。API 费用 $397。
  • 补丁栈:原生补丁树,GPU 物理;传送带任务改用 CPU 物理。fold_clothes_random 和 pour_by_language 在这条管线上没有得分。API 费用 $369。
  • 两条管线的数字不能混比:同一权重在两条管线上也会差出几个百分点。