逐任务结果
每个方块是一回合:实心 = 成功,空心 = 失败,虚线 = 没有得分。点方块看这一回合的头部相机录像、任务指令、调用次数和费用。 点表头可以排序。WAM 两列是同一官方 Docker 管线下 21 回合的结果,官方 Astra 是官方榜单上 GPT-6 Astra 的 Score。
| 配置 | 官方 Docker | Score | 补丁栈 | Score | 官方 Astra | WAM config_exp 60k | WAM skill_fix 40k | 平均调用 | 费用 |
|---|
组合路由估算
19 个任务交给 WAM、35 个交给 GPT,全部取官方 Docker 管线的数字,按官方五维等权平均。这是离线估算,不是榜单成绩: GPT 侧每个配置只有 3 回合,WAM 侧是 7/seed 筛查。
| WAM 侧权重 | Score | 成功率 | 泛化 | 精度 | 长程 | 记忆 | 开放 |
|---|---|---|---|---|---|---|---|
| config_exp 60k EMA | 41.3 | 33.8% | 40.7 | 34.9 | 34.5 | 61.1 | 35.6 |
| skill_fix 40k EMA | 39.3 | 31.4% | 40.4 | 26.6 | 33.0 | 61.1 | 35.6 |
| 官方榜首 Simate-beta | 34.0 | ||||||
组合方案的价值几乎全部来自 GPT 侧的 memory 维(cover_blocks、swap_blocks、match_and_pick、press_by_number)和 stack / arrange / pickup 类任务。早先报告用历史数字回推出的 57.89 在实测下不成立。
设置
harness
- do_harness = Rpent
skill-hybrid-20260921@ 0cfaffc(加 init-shim 修复) - GPT-6 Astra,reasoning high;每回合最多 36 次调用、15 美元
- 感知:只用 RGB,可以额外查询深度;运动:cuRobo
- 原始任务指令,没有 WAM,没有 policy server
两条管线
- 官方 Docker:官方镜像 robodojo:cuda12.8(upstream 726e9aa),CPU 物理,单环境。API 费用 $397。
- 补丁栈:原生补丁树,GPU 物理;传送带任务改用 CPU 物理。fold_clothes_random 和 pour_by_language 在这条管线上没有得分。API 费用 $369。
- 两条管线的数字不能混比:同一权重在两条管线上也会差出几个百分点。