ZIWU AIEmbodied Intelligence Measurement
EMBODIED AI · EVIDENCE, NOT IMPRESSIONS

GPU 仿真评测
从终局到运行证据

ZIWU AI 把具身策略的 GPU 仿真运行转化为可读、可比较、可追溯的证据:任务定义、当前进度、失败位置,以及需要由下一次实验验证的诊断假设。

TASK-GRAPH DIGITAL TWIN · FILL_PEN_HOLDER
Xiaomi_R1 · 四支全部入筒 · SUCCESSACT · 持筒停滞 0/4 · TIMEOUT

同一张任务图回放两条 GPU 仿真轨迹:一条走满插入与计分链路,一条在瓶颈处打转直到超时。点击进入可交互数字孪生。

3 tasks101+ trajectories12 audited frames
03 · LIVE GPU SIMULATION · 真实 GPU 云端仿真
任务平台模型RTX 4090Isaac Sim 6.0.1Xiaomi_Robotics_1seed 0
Overview

轨迹不该只是一段视频
它应该是一段可视化的逻辑链条

Technical framework · Graph × Visualization

从复杂行为演化到可度量坐标系

Connector 接入运行,Graph 记住能力关系,Visualization 把差异摊开;证据再进入选型、门禁、采数和复测。

LIVE · 已有证据NEXT · 近期产品化VISION · 长期网络
ZIWU 从高维任务现实,经语义任务图、任务地形与度量坐标,到评估、诊断和改进的技术框架

这张图展示了 ZIWU 的完整技术沙盘:把终端 Agent、机器人和世界模型产生的运行统一成事件;用语义任务图记住路径与失败;再投影成任务地形和度量坐标。图上每个结论都要能回到具体版本、视频、action 和原生结果。

打开 Task Graph ↗查看 Task Landscape ↗
  1. LIVE01 · Connector接上异构运行

    Task / Robot / Policy / Episode

  2. LIVE02 · Graph连起能力与失败

    Metric / Failure / Evidence

  3. LIVE03 · Visualization把过程讲清楚

    Workflow / Landscape / Replay

  4. NEXT04 · Decision让证据进入工作流

    Match / Gate / Route / Retest

  5. VISION05 · Physical Track进入真实赛道网络

    Test Cell → Robot Town

不是测完就结束,而是让每次运行推动下一次部署和训练。

Evidence shift

从“看了视频”到“知道哪里出了问题”

03

Cohort intelligence

把同任务的 101 条轨迹聚成可追溯的行为群组,分开 demo 与 policy truth。

02

Agent-supervised review

Goal、当前状态、目标距离和中文讲解沿时间轴同步更新。

01

Synchronized evidence

三路相机、逐步 action、原生 score 与运行 manifest 对齐到同一个 step。

Decision depth

从单一 success 到可进入 CI 的质量门禁

G5

Deployment decision · PLANNED

规划将成功率、执行成本与经验证的过程指标组合成发布门禁;当前尚未形成完整企业闭环。

G3

Regression detection

即使都到达相似终点,也能发现更慢、更绕、更抖和更多停滞。

G1

Infrastructure truth

基础设施 pass 只证明环境可运行,不再被包装成 policy success。

Demo atlas

三个策略工作流 逐项进入代表性轨迹

Fill Pen Holder、Organize Table 与 Kongming Lock 各自连接聚合分析、两种策略和三路同步视频。百分比来自报告聚合的 cohort comparison;视频用于检查代表性 Episode,不作为单条轨迹得分。

Policy workflow analysis

把视频行为还原成可检查的任务路径

每张图把动作原语、观测门、恢复分支和失败断点放到同一条工作流中。点击图片打开高清 PDF;已有视频证据的任务可继续进入逐步回放与分析。

Fill Pen Holder 两种策略工作流对比图01点击查看高清图 ↗
fill_pen_holder · policy comparison

Fill Pen Holder

对比多轮闭环自愈与初级开环策略,定位抓取、插入和恢复路径中的关键差异。

闭环策略
Xiaomi_Robotics_1 · 43.3% 满分达成
对照策略
Pi_05 · 23.0% 达成
Organize Table 两种策略工作流对比图02点击查看高清图 ↗
organize_table · policy comparison

Organize Table

对比多阶段闭环规划与长程注意力崩溃,展示杯子、文具和书籍整理链路的失效位置。

闭环策略
Xiaomi_Robotics_1 · 53.3% 成功通关
对照策略
Pi_05 · 0.0% 通关
make_kong · 麻将推牌做杠 两种策略工作流对比图03点击查看高清图 ↗
make_kong · policy comparison

make_kong · 麻将推牌做杠

对比高精双臂闭环策略与初级开环策略,沿双臂策略森林拆解目标锁定、抓取力封闭、0.4mm 空间配准、二次推牌自愈与终局防翻中的关键瓶颈。

闭环策略
Xiaomi_Robotics_1 · 52.3% 工作流达成
对照策略
Pi_05 · 18.5% 工作流达成

证据边界:工作流百分比是聚合结果;详情页视频是每种策略的一条代表性轨迹。每项两种策略只确认 episode index 相同,不声称它们构成 same-seed、same-layout 或 controlled A/B。

01 · Long-Horizon 主 Demo

同一任务   终点相似   中间过程天差地别

任务要求把四个蛋放入蛋盒、关盖并让机器人回到原位。两个官方示教以真实速度同步起播:Episode 2 在 10.80 秒结束,Episode 54 还要继续 18.64 秒。

更快、更直接Official demo · Episode 2
270 frames · 25 FPS视频 10.80 s
终点相似,过程更冗长Official demo · Episode 54
736 frames · 25 FPS视频 29.44 s
0.00 s
对照要点

两次运行耗时分别为 10.80 秒和 29.44 秒。同步多视角回放用于核对额外动作发生在哪个阶段,并将耗时、动作路径、方向反转和低活动步记录为可复测指标。

02 · 系统看见了什么

完成指定目标和执行成本一样重要

绿色代表 Episode 2,橙色代表 Episode 54。全部数字来自官方示教视频与 14 维 action;没有 ground truth 的成功分不会填成 0 或 100。

Episode 2Episode 54本组指标均为 ↓ 越低越好
示教时长三路视频从第一帧到最后一帧;25 FPS
10.80 s
29.44 s
↓ 越低越好快 63.3%
动作空间路径14 维 action 相邻步 L2 变化量总和,不是米
24.00
29.78
↓ 越低越好少 19.4%
方向反转各关节动作增量变号次数;是来回修正代理,不是语义重试
850
2,533
↓ 越低越好少 66.4%
低活动步相邻 14 维 action 变化 L2 < 0.01;是停滞代理
3 · 1.1%
123 · 16.7%
↓ 越低越好3 vs 123
逐步动作活动度

长程差异藏在过程,不藏在最后一帧

每根柱子聚合一段 14 维 action 的相邻变化量。点击柱子可以跳回相应视频时间;Episode 54 的时间轴横跨 29.44 秒,因此相似终点背后的额外等待与反复修正不会消失。

Episode 2
Episode 54
03 · 第二案例:细微退化

差异不总是 2.73×;小退化也值得在上线前被发现

之前的 Fold Clothes 官方示教没有删除。它现在承担更合适的角色:展示肉眼更难稳定识别的 4%–10% 级质量差异。

Fold Clothes Episode 36 最终头部视角
Episode 3612.00 s · action path 27.19
Fold Clothes Episode 93 最终头部视角
Episode 9312.52 s · action path 30.23
SUBTLE REGRESSION10.1%

Episode 36 的动作空间路径更短;同时快 4.2%,最终轮廓矩形度代理高 5.9%。这组差异没有蛋盒那么戏剧化,却正是持续评测与回归检测的价值。

下载 Fold Clothes 报告
04 · 这些指标能解决什么问题

对海量视频数据缺少高质量分析

01

防止 Demo 偏差

“最好看的一次”无法代表部署质量。Anchor 保存完整 run、失败样本和 cohort 分布。

02

发现隐性退化

新 policy 仍然成功,却变慢、绕路、抖动或依赖更多修正;传统 success rate 看不见这些变化。

03

把质量接入 CI

同任务、同 seed、同 rubric 自动对比,让性能退化在合并前被检测,而不是上线后才暴露。

04

形成数据飞轮

失败定位和高质量轨迹筛选反向指导数据采集、policy 训练与下一轮评测。

05 · 证据边界

我们明确区分:示教素材、policy run 与科学结论

这不是免责声明,而是产品能力:系统必须知道自己能证明什么、不能证明什么。

证据事实可用于
Fill Egg Holder · Official Teleop demos两条官方训练示教;最终帧呈现关盖外观;官方 score 未重跑强差异质量对照 Demo
Fold Clothes · Official DateGen demos两条官方训练示教;4%–10% 级过程与视觉代理差异;官方 score 未重跑细微退化检测 Demo
Fill Pen Holder · ACT policy run真实 GPU,success=false,score=0;人工猜测阶段标签已撤回失败诊断 / 基础设施 smoke
本页已经证明
  • 两条蛋盒官方示教可被三视角同步回放
  • 逐步 action 可计算时长、路径、反转与低活动步
  • 强差异与细微退化能进入同一质量账本
  • 系统可以区分“终点相似,但过程质量不同”
本页没有声称
  • 这两条是两个 policy 的同 seed / 同 layout A/B
  • 两条都取得 RoboDojo 官方满分
  • 反转与低活动步等同于人工标注的重试或停滞
  • 两条样本足以证明跨 seed 稳健性
下一份最高可信度 Demo

同任务、同 seed、两个 policy 都通过官方成功门槛,再比较谁完成得更好

在控制任务、种子和场景条件后,进行可复现的策略对比。

  1. 01锁定同一 task / seed / layout / assets
  2. 02两个 policy 均通过官方 score gate
  3. 03比较时间、路径、重试、平滑度和最终质量
  4. 04至少 3 seeds,形成置信区间与回归门禁
可审计来源

所有数字都能回到原始数据