从“看了视频”到“知道哪里出了问题”
Cohort intelligence
把同任务的 101 条轨迹聚成可追溯的行为群组,分开 demo 与 policy truth。
Agent-supervised review
Goal、当前状态、目标距离和中文讲解沿时间轴同步更新。
Synchronized evidence
三路相机、逐步 action、原生 score 与运行 manifest 对齐到同一个 step。
ZIWU AI 把具身策略的 GPU 仿真运行转化为可读、可比较、可追溯的证据:任务定义、当前进度、失败位置,以及需要由下一次实验验证的诊断假设。
Connector 接入运行,Graph 记住能力关系,Visualization 把差异摊开;证据再进入选型、门禁、采数和复测。
这张图展示了 ZIWU 的完整技术沙盘:把终端 Agent、机器人和世界模型产生的运行统一成事件;用语义任务图记住路径与失败;再投影成任务地形和度量坐标。图上每个结论都要能回到具体版本、视频、action 和原生结果。
Task / Robot / Policy / Episode
Metric / Failure / Evidence
Workflow / Landscape / Replay
Match / Gate / Route / Retest
Test Cell → Robot Town
不是测完就结束,而是让每次运行推动下一次部署和训练。
把同任务的 101 条轨迹聚成可追溯的行为群组,分开 demo 与 policy truth。
Goal、当前状态、目标距离和中文讲解沿时间轴同步更新。
三路相机、逐步 action、原生 score 与运行 manifest 对齐到同一个 step。
规划将成功率、执行成本与经验证的过程指标组合成发布门禁;当前尚未形成完整企业闭环。
即使都到达相似终点,也能发现更慢、更绕、更抖和更多停滞。
基础设施 pass 只证明环境可运行,不再被包装成 policy success。
Fill Pen Holder、Organize Table 与 Kongming Lock 各自连接聚合分析、两种策略和三路同步视频。百分比来自报告聚合的 cohort comparison;视频用于检查代表性 Episode,不作为单条轨迹得分。
每张图把动作原语、观测门、恢复分支和失败断点放到同一条工作流中。点击图片打开高清 PDF;已有视频证据的任务可继续进入逐步回放与分析。
证据边界:工作流百分比是聚合结果;详情页视频是每种策略的一条代表性轨迹。每项两种策略只确认 episode index 相同,不声称它们构成 same-seed、same-layout 或 controlled A/B。
任务要求把四个蛋放入蛋盒、关盖并让机器人回到原位。两个官方示教以真实速度同步起播:Episode 2 在 10.80 秒结束,Episode 54 还要继续 18.64 秒。
两次运行耗时分别为 10.80 秒和 29.44 秒。同步多视角回放用于核对额外动作发生在哪个阶段,并将耗时、动作路径、方向反转和低活动步记录为可复测指标。
绿色代表 Episode 2,橙色代表 Episode 54。全部数字来自官方示教视频与 14 维 action;没有 ground truth 的成功分不会填成 0 或 100。
每根柱子聚合一段 14 维 action 的相邻变化量。点击柱子可以跳回相应视频时间;Episode 54 的时间轴横跨 29.44 秒,因此相似终点背后的额外等待与反复修正不会消失。
之前的 Fold Clothes 官方示教没有删除。它现在承担更合适的角色:展示肉眼更难稳定识别的 4%–10% 级质量差异。


Episode 36 的动作空间路径更短;同时快 4.2%,最终轮廓矩形度代理高 5.9%。这组差异没有蛋盒那么戏剧化,却正是持续评测与回归检测的价值。
下载 Fold Clothes 报告“最好看的一次”无法代表部署质量。Anchor 保存完整 run、失败样本和 cohort 分布。
新 policy 仍然成功,却变慢、绕路、抖动或依赖更多修正;传统 success rate 看不见这些变化。
同任务、同 seed、同 rubric 自动对比,让性能退化在合并前被检测,而不是上线后才暴露。
失败定位和高质量轨迹筛选反向指导数据采集、policy 训练与下一轮评测。
这不是免责声明,而是产品能力:系统必须知道自己能证明什么、不能证明什么。
fill_pen_holder 页面保留了 1100-step trace、三路同步视频、GPU manifest、过程指标和轨迹视图;原因只作为可验证假设。