fill_pen_holder 任务图数字孪生
页面把七条可复核的 GPU 仿真运行投影到同一张规范任务图上。三路视频、谓词翻转和原生终局彼此绑定,用来定位失败发生在哪一段,并形成可验证的诊断假设;它们不等同于真机证据或因果证明。生产版支持追加 LIVE 仿真;本评审副本已与生产触发服务隔离。
离线仿真运行:视频与任务图同轴回放
五个 GPU 仿真 RunBundle 的离线回放。首张来自 RoboFlex T0(插充电器、8 mm 公差、400 步、 记录到 0 个穿模事件),其余四张是 2026-08-19 的运行样本。视频位置映射到 policy tick, 并同步驱动任务图与双臂轨迹;原生终局仍以 RunBundle 中的结果文件为准。
RunPod 全程实跑 · Xiaomi_R1 · 1100 步
RunPod · RTX 4090Xiaomi_Robotics_11100 / 1100 steps原生 score=0.4 · 未成功 · 1100 步超时Modal 短跑 · Xiaomi_R1 · 150 步(自定步数首验)
Modal · L40SXiaomi_Robotics_1150 / 150 steps原生 score=0 · 150 步上限截断(步数旋钮首验)Modal 短跑 · π0.5 · 100 步(页面触发彩排)
Modal · L40Sπ0.5 · Pi_05100 / 100 steps原生 score=0 · 100 步上限截断(演示短跑)- 0–50右臂接近笔筒未抓取
- 50–60首次闭爪碰倒笔筒
- 60–80松爪回撤筒仍倒地
- 80–99再次闭爪无笔入筒
π0.5 输出关节空间动作,trace 无 ee_pose,故以 Agent 事件时间轴代替轨迹剖面
RunPod 短跑 · π0.5 · 150 步
RunPod · RTX 4090π0.5 · Pi_05150 / 150 steps原生 score=0 · 150 步上限截断- 0–90右臂前伸接近笔筒
- 90–110首次闭爪抓住笔筒
- 110–130松爪回撤未取笔
- 130–149再次闭爪碰倒笔筒
π0.5 输出关节空间动作,trace 无 ee_pose,故以 Agent 事件时间轴代替轨迹剖面
RoboFlex 公差阶梯:Xiaomi_R1 的本任务结果
在同一仿真任务中把横向对准公差设为 8 / 4 / 2 mm,每档 3 个 seed,共 9 条运行。 Xiaomi_Robotics_1 在三档均为 0/3;这说明该策略在这组设置下未通过,但不能外推为所有 VLA 的通用精度结论。9 条运行的物理侧写均为 ok,因此已记录的穿模不能解释这条平零线; 精度假设仍需脚本基线或扰动实验验证。
代表性失败(最有说服力的一条):最宽 8mm 档、seed 0——VLA 抓起了插线板却始终无法完成对准插入,score=0。run 20260824-flexscan-tol8-s0 · seetacloud 4090D
选择单次轨迹,三路同步复核
七条 Episode trajectory 共用播放、定位与任务图。前四条锚点来自视觉判读;三条 XR1·trace 轨迹的锚点来自逐步谓词与里程碑原生真值。
任务结构、单次轨迹与群体证据分层呈现
灰色骨架是 fill_pen_holder 的 Canonical Task Graph(v6 简化布局),描述任务结构并对所有策略与运行保持不变。彩色线是所选 Episode trajectory 的投影;右下蓝色数字是 150 条运行形成的 Cohort Landscape/Profile 里程碑计数(150→144→121→92→35)。多次运行只聚合统计,不生成或改写规范任务图。
页面能证明什么,不能证明什么
先看原生结果和证据等级,再读路径与诊断假设。
当前页面证明的是 GPU 仿真运行中的原生终局、逐步谓词、同步视频和里程碑计数。不同轨迹的证据等级不同:视觉锚点存在 ±25–50 帧误差;XR1·trace 锚点来自逐步原生真值;“无逐步观测”表示没有采集对应谓词,不能当作通过或行为分支。页面可以定位失败路径并提出可证伪的诊断假设,但不直接证明根因。LIVE 当前只提供 policy tick、头部相机帧与流水线阶段。群体计数与单条轨迹不能互相替代。本页没有实体机器人运行或 Sim-to-Real 配对证据。