正在加载评测记录…
PROTOCOL
这次测了什么
规划与执行
GPT-6 Astra,medium reasoning,经 OpenRouter Responses API;RPent lean harness,最近两轮历史、STATE 记录与最新观测。GPT 使用运动工具直接操作双臂,policy_actions 为 0。本页是经验规则以提示词注入的基线;多阶段代码控制实验在独立页面报告。
输入与成功判定
头部和腕部图像、物体真实位姿与原生条件反馈均对 GPT 可见,包含特权状态信息。只有原生 eval_success=true 才算成功;单个深度或朝向条件通过不代表任务完成。
测试边界
204 上的原生仿真环境,非官方 Docker;key 300 步,tubes 500 步。渲染有至少一帧延迟警告。每项只测 seed 0 / layout 0,不能由此推断 42 个任务总分或稳定成功率。
规则来源
此前成功与失败轨迹,以及 PhysicalRSI 动作视频的观察。本地资产几何用于区分钥匙柄、尖端和齿侧;这些是本次待验证的提示规则。PhysicalRSI 项目。
RPent 818f4188 · 下载本页结果与操作记录 JSON