正在加载评测记录…
PROTOCOL
这次测了什么
规划与执行
GPT-6 Astra,medium reasoning,经 OpenRouter Responses API;RPent lean harness,最近两轮历史、STATE 记录与最新观测。GPT 调用 insertion_stage,代码执行抓取、换手、摆正、对孔、分段插入和撤离。policy_actions 为 0;原始 move_to / reset 工具在此模式下已替换。
输入与成功判定
头部和腕部图像、物体真实位姿与原生条件反馈均对 GPT 可见,包含特权状态信息。只有原生 eval_success=true 才算成功;单个深度或朝向条件通过不代表任务完成。
测试边界
204 上的原生仿真环境,非官方 Docker;key 300 步,tubes 500 步;每项最多 40 个 GPT 回合,与提示词基线的 200 回合预算不同。渲染有至少一帧延迟警告。每项只测 seed 0 / layout 0,不能由此推断 42 个任务总分或稳定成功率。
规则来源
此前成功与失败轨迹,以及 PhysicalRSI 动作视频的观察。动作顺序参考视频,尺寸按本地原版资产标定;这些是待验证的控制模板。视频不能精确证明松手深度,也不能证明本控制器会成功。PhysicalRSI 项目。
RPent fdd4faf3 · 控制器 physicalrsi_v1 · 下载本页结果与操作记录 JSON