逐任务结果
每个方块是一回合(layout 0 / 1 / 2):实心 = 成功,空心 = 失败。点“GPT + skill30”的方块看录像和逐轮操作; GPT-only 一列是不用 WAM 的对照(官方 Docker),官方 Astra 是官方榜单上 GPT-6 Astra 的 Score,skill30 纯 WAM 是同一权重不经 GPT 在 官方 Docker 上的成功回合数(每配置 21 回合)。点表头排序。
| 配置 | GPT + skill30 | 平均轮数 | 平均费用 | GPT-only | 官方 Astra | skill30 纯 WAM |
|---|
组合路由估算
19 个任务交给 skill30 纯 WAM(官方 Docker,每配置 21 回合),35 个任务交给 GPT 一侧,按官方五维等权平均成功率, 排名对照官方榜单 2026.9.23 的成功率列。离线估算,不是榜单成绩:GPT 一侧每个配置只有 3 回合;这个 harness 不记录原生部分得分, 所以这里只比成功率。
| GPT 一侧 | 成功率 | 排名 | 泛化 | 精度 | 长程 | 记忆 | 开放 |
|---|---|---|---|---|---|---|---|
| GPT 调用 skill30(本页) | 27.7% | 2 | 31.9% | 17.3% | 29.8% | 22.2% | 37.5% |
| GPT-only(不用 WAM) | 33.0% | 1 | 31.9% | 25.6% | 17.3% | 61.1% | 29.2% |
设置
harness 与 GPT
- RPent
skill-hybrid-20260921@ f2977bc,lean harness,技能指令格式fields_v1 - GPT-6 Astra(OpenRouter),reasoning medium,每回合最多 100 轮
- GPT 的工具:skill_propose / skill_act(交给 skill30)、move_to(自己移动手臂)、view_env_state、sample_world_xyz、stop / reset / finish
- 成功由 RoboDojo 原生判定
episode_status.eval_success给出
仿真与 policy
- 官方镜像 robodojo:cuda12.8(upstream 726e9aa),官方默认 CPU 物理;只挂载了 RPent 自带的 cuRobo 适配补丁,按钮关节修正已关闭
- skill30 w125 spell02 30k EMA,denoise 10,推理 shared_timestep=1,与纯 WAM 评测同一份模型代码
- 每张 L40S 上一个 policy server 加一局仿真;文本编码先查训练缓存,未命中时在 CPU 上用 Gemma 编码
- RUN
skill30_s030000_gpt35_rpent_docker_20260925;2 回合因 OpenRouter 临时 502/507 错误重跑过