← 评测总览

DO-WAM · RoboDojo 仿真基准 · GPT + skill30 · 09-25

GPT 调用 skill30:35 个 GPT 路由配置

GPT-6 Astra 做规划,需要接触物体时把原子技能交给 skill30 30k 执行:用 skill_propose 预测、检查后用 skill_act 执行, 指令是 skill30 训练时的字段格式(例如 Skill: PICK. Effector: left. Object: yellow cup.);GPT 也可以自己用 move_to 移动手臂。 覆盖组合路由方案里交给 GPT 的 35 个任务配置,每个配置 layout 0、1、2 各一回合,仿真在官方 Docker 镜像里(CPU 物理)。 点任一回合的方块,可以看录像和 GPT 每一轮的完整操作。

GPT + skill30

30.5%

32 / 105 回合成功

同样 35 个配置 · GPT-only

34.3%

36 / 105 回合成功,同一官方 Docker 管线

平均每回合

67 轮

GPT 调用;API 费用平均 $15.3,合计 $1,605

组合路由估算 · 成功率

27.7%

19 个 WAM 任务用 skill30 纯 WAM + 这 35 个;离线排名第 2

逐任务结果

每个方块是一回合(layout 0 / 1 / 2):实心 = 成功,空心 = 失败。点“GPT + skill30”的方块看录像和逐轮操作; GPT-only 一列是不用 WAM 的对照(官方 Docker),官方 Astra 是官方榜单上 GPT-6 Astra 的 Score,skill30 纯 WAM 是同一权重不经 GPT 在 官方 Docker 上的成功回合数(每配置 21 回合)。点表头排序。

配置 GPT + skill30 平均轮数平均费用 GPT-only 官方 Astra skill30 纯 WAM
成功失败 GPT-only 成功(对照)没有结果

组合路由估算

19 个任务交给 skill30 纯 WAM(官方 Docker,每配置 21 回合),35 个任务交给 GPT 一侧,按官方五维等权平均成功率, 排名对照官方榜单 2026.9.23 的成功率列。离线估算,不是榜单成绩:GPT 一侧每个配置只有 3 回合;这个 harness 不记录原生部分得分, 所以这里只比成功率。

GPT 一侧成功率排名泛化精度长程记忆开放
GPT 调用 skill30(本页)27.7%231.9%17.3%29.8%22.2%37.5%
GPT-only(不用 WAM)33.0%131.9%25.6%17.3%61.1%29.2%

设置

harness 与 GPT

  • RPent skill-hybrid-20260921 @ f2977bc,lean harness,技能指令格式 fields_v1
  • GPT-6 Astra(OpenRouter),reasoning medium,每回合最多 100 轮
  • GPT 的工具:skill_propose / skill_act(交给 skill30)、move_to(自己移动手臂)、view_env_state、sample_world_xyz、stop / reset / finish
  • 成功由 RoboDojo 原生判定 episode_status.eval_success 给出

仿真与 policy

  • 官方镜像 robodojo:cuda12.8(upstream 726e9aa),官方默认 CPU 物理;只挂载了 RPent 自带的 cuRobo 适配补丁,按钮关节修正已关闭
  • skill30 w125 spell02 30k EMA,denoise 10,推理 shared_timestep=1,与纯 WAM 评测同一份模型代码
  • 每张 L40S 上一个 policy server 加一局仿真;文本编码先查训练缓存,未命中时在 CPU 上用 Gemma 编码
  • RUN skill30_s030000_gpt35_rpent_docker_20260925;2 回合因 OpenRouter 临时 502/507 错误重跑过

轮工具指令 / 参数GPT 的判断执行步仿真步费用