Chapter 13 · Glossary & Method

术语词典与方法论

每个术语给三样东西:正式定义、大白话、以及一个类比。 后半部分是本图谱全部的口径声明与已知局限——这一节的作用是让每个判断都可以被复核。

方法论与口径声明

证据分级规则

等级包含使用规则
一手 arXiv 论文、官方技术博客、GitHub / HuggingFace 模型卡、招股书、审计财报、监管文件、招标公示、政府渠道 可作为硬数字使用
转述 权威财经媒体报道、券商研报中的第三方引述 可用于趋势判断,标注媒体名与日期
自述 / 估算 公司融资通稿、未审计营收、分析师推算、媒体基于产能的估算 不得作为硬数字,须标明来源性质

八条硬性口径规则

  1. 不同等级的数字之间不做比较。审计营收与未审计自述营收不并列排序。
  2. 雷达图采用 best-normalized 归一化:每条轴取有公开数据者的最优值为 100, 其余按比例折算。仅同轴内可比,跨轴数值无意义,雷达面积不代表综合实力。
  3. 「未报告」不画作 0,用斜纹标记并断开多边形。 画成 0 会把「未披露」误读成「能力为零」。
  4. 延迟必须同硬件、同精度、同测量边界才可比较。 已确认的不可比实例:面壁 120 ms(H100 / 单帧 / 仅模型前向)与灵波 130 ms (RTX 4090D / 10 步去噪 / 端到端);同一个 π0 在 Thor 优化部署下 52.57 ms、 在 Orin 未优化下 2966 ms,相差近 60 倍。
  5. 厂商自测竞品需单独标注,不与该竞品官方口径混用。
  6. 选择性对比必须补全最强基线。例:面壁 RMBench 对比表列了 π0.5(10.4) 未列 Mem-0(42.0),真实领先幅度应按 Mem-0 计算。
  7. 数据规模需区分单位。轨迹条数、小时数、帧数三者不可混用; 并区分「累计采集」与「清洗后可用」——灵波淘汰率 44%,千寻可用率从 30% 提升到 95%。
  8. 「预训练覆盖某构型」不等于「量产默认大脑」。 前者是技术事实,后者需要商务合同与验收证据。

已知局限

本图谱没有做到的六件事

没有中国本土数据采集成本的一手拆解(人力、场地、折旧、后处理分项)—— 所有成本数字来自行业估算站或商业博客;
没有任何案例的权威人力替代比与投资回收期——检索未获得可靠来源;
没有对 Figure、Gemini Robotics 2、π0.7 等闭源模型的能力量化—— 这些模型未公开百分比,无法进入任何能力图;
没有做零部件 BOM 成本拆解,上游只做议价结构判断;
没有独立复现任何一项基准,全部依赖公开报告;
数据截至 2026 年 8 月,此后的发布与融资未纳入。

本图谱刻意不做的三件事

不预测谁会赢。三个最关键的分歧目前都没有决定性证据(第 12 章)。
不把厂商自报数字当作事实。凡属自述均标注等级并说明测量条件。
不用「颠覆」「引领」「遥遥领先」这类无法验证的表述。 所有强判断都必须附带可核查的一手来源。

术语词典

/ 聚焦

模型与架构

VLAVision-Language-Action

接收视觉观测与自然语言指令、直接输出机器人控制信号的统一模型。

机器人版的「看—听—做」一条龙大脑:看一眼、听懂话、动手。

像同声传译,只是把「画面 + 一句话」直接翻译成「手怎么动」。

分层式端到端

对外是单一训练与部署管线,内部按时间尺度或功能分成慢快子模块并联合优化。

外表是一个大脑,里面其实有「想事的人」和「动手的人」分工,但一起练。

2026 年的事实主流形态,见第 03 章。

双系统架构System 1 / System 2

慢速 VLM 推理与快速动作策略互补组合,前者负责语义与规划,后者负责连续动作。

一个负责想「做什么」,一个负责「怎么快速做」。

司机握方向盘做毫秒级反应 + 副驾导航每几秒说一句「下个路口左转」。

flow matching流匹配

学习一个向量场,把随机噪声逐步推成目标动作分布的连续生成方法,属扩散模型变体。

不是一格一格猜下一个动作,而是把一团乱线整体「吹」成整齐轨迹。

用导航重新规划路线:看当前偏了多少,一步步把路线推回正轨。

action chunking动作分块

一次预测未来多步动作序列,控制器依次执行若干步后再重新规划。

一次想好接下来半秒到一秒怎么动,而不是每毫秒重新想。

跳水运动员入水前在脑中预演完整动作串。代价是执行期间看不到新画面—— 相当于设了 5 秒自动驾驶后才发现前面有坑,而这 5 秒眼睛是被蒙住的。

action token动作 token

把连续关节角度或末端位姿离散化成类似「单词」的符号,供语言模型式自回归预测。

把手臂动作切成一个个「字母」,让 AI 像打字一样逐个拼出动作。

FAST tokenizer

对动作块做离散余弦变换加 BPE 压缩,得到少量 dense action token。

像 JPEG 压图片那样压动作,把一长串动作挤成几十个符号。

世界模型World Model

学习环境在动作下如何演化的预测模型,可推演未来状态。

机器人脑内的「物理引擎 + 预言机」:做了这个动作,世界会变成什么样。

飞行模拟器。区别在于飞行模拟器背后有精确的气动方程, 而学出来的世界模型,它的「物理定律」是猜出来的。

WAMWorld Action Model,世界动作模型

同时建模未来状态与动作的具身基座模型,2026-05 综述正式命名。

不只决定手怎么动,还同时想象画面会怎么变。

WUMWorld Unified Model

自变量的私有术语,指视觉、语言、动作、物理预测在同一网络从零联合训练。 非学术标准术语,未被 WAM 综述收录。

把看、想、说、动、物理规律全塞进一个大脑,不要模块拼装。

能力与瓶颈

compounding error误差累积

自回归预测中误差逐步累积,长时程预测偏离真实动态。

想象越远越跑偏。

传话游戏,每传一次偏一点。

cross-embodiment跨本体

同一模型跨不同机器人本体(不同自由度、传感器、动作空间)训练或迁移。

同一份操作经验教给不同类型的机器人。

负迁移风险:把游泳教练的训练手册直接给滑雪选手, 动作库越杂越互相干扰。已被实验证实(77.3% → 72.1%)。

一脑多机

一套具身基座模型通过跨构型预训练与后训练,驱动不同品牌形态的机器人。

一个通用大脑装到不同身体上。

目前是技术事实,不是商业事实—— 没有任何一家公开过模型授权收入(第 10 章)。

sim-to-real gap

同一策略在仿真与真实机器人上表现的系统性差异。

电脑里很会做题,真机一上手就翻车。

domain randomization域随机化

在仿真中随机化纹理、光照、摩擦与杂物,逼策略学习不变性。

仿真里故意把桌子弄乱、灯光乱闪,让模型别只背一种环境。

数据墙

高质量机器人动作数据无法从互联网获取、只能真机采集所形成的规模与成本约束。

机器人的「教材」得一条条自己拍,拍不出足够多就学不会。

大语言模型时代「高质量文本稀缺」在物理世界重演。 但智元用 236 小时精选数据超过 OXE 约 2000 小时的效果说明: 墙不只是高度问题,更是密度与质检问题。

数据飞轮

部署 → 采集数据 → 训练模型 → 提升性能 → 更多部署的正反馈循环。

机器人越干活越聪明,越聪明越多人买,买了又产生更多数据。

数据与采集

post-training后训练

大规模预训练后,用任务或本体特定数据做微调。

通识毕业后再上岗培训,学具体工种。

遥操作teleoperation

人类操作员通过远程控制接口实时驱动机器人,而非自主策略输出动作。

像遥控赛车:看起来是机器人在动,其实是人在后面拨杆。

识别 demo 真伪的关键概念。Tesla Optimus 发布会交互、 1X NEO 的 Expert Mode 均属此类。

Ego-centric第一人称视角数据

以操作者第一人称(头戴或腕部相机)记录环境与手物交互。

戴着 GoPro 看自己双手干活。

看全网烹饪视频学做菜:场景极多几乎免费,但视频里没有你家灶台的坐标。

UMIUniversal Manipulation Interface

手持夹爪加相机加 SLAM,把野外人类演示转成可部署机器人策略的标准接口。

不用搬整台机器人,拿个便携夹爪相机就能采数据,约 30 秒一条。

基准与指标

LIBERO

2023 年发布的仿真操作基准,130 个语言条件任务,分 Spatial / Object / Goal / Long 四类。

给机械臂玩的标准化考试卷,题都在电脑里的假桌子上。

已饱和且被证伪:主流模型挤在 94.8–98.9,已有模型在子集考到 100.0%; 而只把物体挪动位置,OpenVLA 的分数就从 76.5% 跌到 1.1%。 相当于学生把 130 道原题背到接近满分,考官只把杯子挪 5 厘米,就几乎全错。

CALVIN ABC→D

语言驱动长链操作基准,在 A/B/C 三个房间训练、第四个新房间 D 测试, 指标为平均完成链长(非成功率百分比)。

让机械臂按口头指令连续做好几步,换到新房间看还能不能做完。

RoboTwin 2.0

50 个双臂仿真任务加强域随机化,分 Clean 与 Randomized / Hard 两档。

电脑里用两只机械臂做 50 道题,还能故意把灯光杂物弄乱加难度。

本图谱中唯一有四家模型同台可比的基准, 但四家差距已在 2.4 个百分点内、且 Hard 与 Clean 几乎无差——也在接近饱和。

RMBench

2026 年基于 RoboTwin 2.0 构建的 9 个记忆依赖双臂任务基准。 勿与语言模型领域的 RM-Bench 混淆。

考机械臂有没有记性:之前藏起来的东西还能不能找回来。

全行业只有 3 个模型报告过——参与者太少,不适合作为雷达轴。

success rate成功率

规定尝试次数或时限内,任务完全满足成功条件的比例。

考十次有几次整张卷子全对。

已知缺陷:无法区分「语义理解对了」与「物理执行成了」 (arXiv:2606.30686)。

Q-score

BEHAVIOR-1K 使用的子目标完成比例指标。

不看有没有做完,看做完了几分之几。

已知缺陷:对违规不敏感—— 85% 的 rollout 存在目标违规,但 Q-score 数值不变。

算力与部署

TOPS / TFLOPS

每秒万亿次整数 / 浮点运算。嵌入式 AI 常用 INT8 Sparse(TOPS) 或 FP4 Sparse(TFLOPS)口径。

芯片算力的名片数字。

不可直接比较:Thor 的 2070 TFLOPS(FP4)与 Orin 的 275 TOPS(INT8)是两种度量。 更接近实际的类比:Orin 像 275 马力家用车,Thor 像账面 2070 马力赛道版; 但 VLA 的动作头像拖着重挂车,瓶颈常在内存带宽,所以 3B 模型在 Thor 上也就约 11 Hz。

控制频率Hz

每秒下发多少次关节或末端指令。

30 Hz 就是每秒 30 次,越高动作越连贯。

全身控制分层像乐队:指挥(VLA,10 Hz)说「这段抬左手」, 乐手(低层控制器,500–1000 Hz)按毫秒调每个关节力矩。让指挥亲自按每个键必然跟不上。

决策延迟

从观测输入到动作输出的时间,不含机械执行。

模型「想一步」要多久。超过 100 毫秒,在 30 Hz 控制环上容易顿一下。

必须问测量条件:同一个 π0 在两篇一手论文里相差近 60 倍。

视觉 token 压缩

减少每帧图像编码进语言模型的 token 数量。

把一张图用更少的「词块」表示,省算力。

流式推理

复用历史 KV cache,增量处理新帧而非全量重算。

看监控不翻旧录像,只更新新画面。

面壁靠这个把每步计算量从 125 TFLOPs 压到 3.3 TFLOPs, 才能在保留 60 帧历史的同时维持实时。

商业与资本

本体

机器人的物理载体:机械结构、执行器、传感器与边缘计算单元。

机器人的「身子」——胳膊腿、关节、摄像头。

PoC概念验证

小规模限时单场景测试,验证技术可行性,通常不以稳定盈利为目标。

先试试看能不能干成,不是正式大规模卖。

框架协议

约定未来一段时间的采购规模、价格机制或合作条款,未必立即交货付款。

先签意向大单,真交付另说。

阅读订单新闻时最需要识别的概念。

单位经济性unit economics

单台或单任务层面的收入、成本、毛利与回本周期。

每台机器人算细账:赚不赚钱、几年回本。

本图谱唯一能算清的一例:优必选 76 万元/台 × 1,079 台,全公司仍净亏 7.90 亿元。

投前 / 投后估值

新资金进入前 / 后的公司整体估值(投后 = 投前 + 本轮金额)。

投资人进来之前 / 之后,公司这个标的的价格。

估值倒挂

二级市场价格低于一级市场最近一轮私募估值。

上市反而比私募轮更便宜,早期投资人账面亏损。

宇树从一级 127 亿到发行市值 609.93 亿,方向是反的(发行价高于私募轮); 但它截至 2026-08-14 尚未挂牌,是否出现倒挂要等二级市场连续报价才知道。

RaaSRobot as a Service

按使用量或时长收费的机器人服务模式,而非一次性售卖硬件。

不卖机器人,按小时租给你用。

GXO 与 Agility 的多年合约是行业首例, 但 GXO 的 CEO 在 2026 Q2 财报电话会上明确表示尚未实现投资回报。

完整来源清单

本图谱共引用约 90 个独立来源。按类型分布:

50+
arXiv 论文与会议论文
6
监管文件与审计财报
宇树招股书、优必选年报、GXO 财报会等
15+
官方技术博客与模型卡
20+
财经媒体与券商研报

每一章末尾列出该章的具体来源。 所有链接均在正文相应位置给出;凡未给链接的数字,均在括号中标注了来源机构与日期。

回到起点 如果只带走一条方法:遇到任何具身智能的能力宣称,先问三个问题—— 谁测的、什么条件下测的、谁选择了不参加。 这三个问题能过滤掉本图谱调研中遇到的绝大多数失真。
13 / 13 · 全篇完
具身大脑产业系统性图谱 · 数据截至 2026 年 8 月
面壁智能 · 首席科学家助理 · 内部研究材料
本图谱不预测胜负,只标注证据等级。发现事实错误或口径问题请直接指出。