Embodied Brain · Industry Map · 2026-08

具身大脑产业
系统性图谱

机器人的「大脑」到底做到了什么程度,谁在做,怎么赚钱。
这份图谱不是行业综述,而是一条可以被检验的推理链。

17.30%
真机考试 GM-100 上,目前最好模型的平均成功率
arXiv:2601.18692
12.4%
完整家务考试 BEHAVIOR-1K 上,挑战赛冠军的成绩(全程做对才算过)
arXiv:2512.06951
100.0%
最常用的仿真考试 LIBERO,已有模型在其中一个子集上考了满分
G0.5 · arXiv:2608.11739
74%
中国人形机器人招采金额中,国有单位占比
虎嗅统计 · 302 项目

上面前三个数字,来自同一批模型的三场考试。

LIBERO 是行业最常用的仿真考试:在桌面上抓一下、放一下, 物体摆放位置每次固定。星海图的 G0.5 在它的一个子集上考了 100.0%,满分。

BEHAVIOR-1K 换了考法——五十项完整家务,比如把餐具收进洗碗机。 中间任何一步失手,整项就算零分。2025 年挑战赛冠军的成绩是 12.4%

GM-100 把考场搬到真机器人上:一百项任务、三种不同的机器人, 目前最好成绩 17.30%

从 100% 到 12.4%,不是因为哪张卷子特别刁难, 而是它们测的根本不是同一件事:LIBERO 问的是「这一下动作做得对不对」, 另外两个问的是「一件完整的事能不能从头做到尾」。 单个动作,机器人已经接近满分;一件完整的事,还在一成出头。

所以听到「我们的大脑领先」这句话时,第一个该问的不是领先多少, 而是这个成绩报在了哪张卷子上。 把各家用的卷子摊开对一遍,是这份图谱要做的第一件事——第 04 章。

这份图谱在论证什么

大部分具身智能报告是主题目录:技术路线一章、玩家一章、投融资一章,彼此之间没有因果关系。 读完知道了很多名词,但仍然无法判断「某家公司说自己大脑领先」这句话可信度有多高。

这份图谱换一种写法:每一章的结论,直接作为下一章的前提。 下面把这条链先说一遍,读者可以据此判断哪一环最值得细看。

起点是物理世界给机器人定的三条硬规矩——换个没见过的房间还得能干活、 每一步决策要在几十毫秒内出结果、还得记住几分钟前发生了什么。 这三条互相冲突:模型做大,换房间的能力变好,但一步决策就慢了下来; 把速度压上去,又装不下那几分钟的记忆。 所以技术路线之间比的不是谁更聪明,而是各自选择牺牲哪一条

往下推会发现四条主流路线最后都撞上同一个问题。 文字和图片可以从互联网上大量抓取,但「手臂该往哪转多少度」这种动作数据不行, 只能让真机器人一条一条采出来。行业提出过三条捷径——在仿真环境里练、 让机器人看人类干活的视频、用世界模型自己生成练习数据。 把一手证据放在一起看,三条都能把要采的量压小,但都压不到零。

于是真机数据成了这个产业里最硬的资产:花钱买不到、用算法也补不齐, 只能靠长期待在真实场景里一点点攒。谁手上有它,谁在产业链上说话就算数。 这一条直接决定了公司只有三种活法可选: 用资本和生态换别人的数据、自己养一支采集队伍、 或者靠机器人出货量顺带把数据收回来。第 07 到 09 章各看一种。

最后三章做检验:这三种活法的钱到底收不收得上来、 资本按什么逻辑给它们定价,以及这整条推理最可能在哪一环断掉。

01 · 02 物理世界的三条硬规矩 换房间 · 反应速度 · 记住几分钟 决定 03 路线只能这样妥协 四条路已收敛成一种做法 04 成绩不能横向比 各家自选卷子,最常用的已失效 于是只能看真机 05 四条路撞同一个问题 动作数据只能真机一条条采 三条捷径 省不到零 05 真机数据成了最硬资产 买不到,也补不齐 决定 06 谁说话算数 五个环节里握数据的最强 决定 07 大厂全栈派 换别人的数据 08 独立大脑派 自己养采集队伍 09 本体自研派 靠出货顺带收数据 钱收得 上来吗 10 只有一种有硬收入证据 另四种模式还只有故事 11 三套定价逻辑 股市刚开始检验估值 12 · 回到起点 整条推理最可能断掉的三处:技术路线是否真会收敛 · 只卖大脑不造机器人是否是门生意 · 数据越多能力是否真的越强 这三处正反双方都有一手证据。图谱不给结论,只说明各自的证据是什么、该盯什么信号。
整份图谱的推理顺序。每一章的结论直接构成下一章的前提, 所以顺读最省力;点侧栏也可以直接跳,每章开头会重述上一章的结论。 链条上有两处转折最值得看:标着「但」的那一步——技术路线看起来收敛了, 可衡量成绩的方式本身失效了;以及标着「三条捷径省不到零」的那一步—— 省数据的办法确实都有,但没有一个能省到不用真机器人。

先读这一节:三个必须先建立的认知

一、「具身大脑」不等于「装在机器人上的大模型」

大语言模型的输出是文字,错了可以重说。具身大脑的输出是 控制指令, 错了会把杯子打翻、把零件装歪。它必须同时满足三件在数字世界里不存在的要求: 换个没见过的房间还能干活(泛化)、 每一步决策必须在几十毫秒内出结果(实时)、 以及记住几分钟前发生了什么(长程记忆)。 这三条互相拉扯:模型做大,换房间的能力变好,但一步决策就慢了; 把速度压上去,又装不下那几分钟的记忆。 所以各条技术路线的差别,说到底就是先放弃哪一条。

二、各家公布的能力数字,大多不能放在一起比

行业里有十几套公开的考试(术语叫 基准), LIBERO、CALVIN、RMBench、RoboTwin、SimplerEnv、GM-100 都是其中的一套。 问题是每家公司只公布自己考得好的那几场: 面壁公布 RMBench 和 CALVIN 的成绩,蚂蚁灵波一场 LIBERO 都不报, 星海图报 LIBERO 和 SimplerEnv,字节和北京人形干脆不参加任何仿真考试、只报真机任务。

换句话说,不存在一场所有主流模型都参加的统考。 所以看到任何一张跨模型对比图,第一个该问的不是「谁分高」, 而是「谁参加了、谁没参加」——一家公司在某项上是空白, 可能是能力不行,也可能只是它选择不考。这两种情况在图表上长得一模一样。 第 04 章会把这件事完整摊开。

三、Demo 与产品之间的差距是系统性的,不是个别夸大

特斯拉 Optimus 在发布会上的对话与交互经彭博社确认为 遥操作; 1X 的 NEO 官方披露有「Expert Mode」由人接管复杂家务; 行业演示视频普遍 2 至 4 倍速播放。 这不意味着技术是假的,而意味着判断进展必须换指标: 不看 demo 完成度,看真机连续无干预运行时长,以及客户第二次是否付钱。

阅读这份图谱时的一个提醒

全站数字都标注了证据等级。 一手 指论文、财报、监管文件、招标公示; 转述 指权威媒体报道; 自述/估算 指厂商自报或分析师推算,未经第三方核实。 遇到关键判断请优先看等级,而不是看数字大小。等级不同的数字之间不做比较。

全部章节

01
焦点为何转向大脑
本体已能量产,卡住的是智能。宇树把 IPO 募资的约一半投向模型研发, 却在招股书里承认自研大模型尚未规模化部署。
02
物理世界三道约束
泛化衰减 46.7 个百分点、延迟预算只有几十毫秒、记忆窗口决定长任务上限。
03
四条路线四种妥协
分层解耦、端到端、内部再分层、世界模型。为什么 2026 年答案已趋同。
04
模型能力对照
头对头雷达、披露完整度雷达、唯一可比基准,以及为什么这些数字大多不可比。
05
数据墙与绕墙尝试
仿真、看人类视频、世界模型三条捷径各能省多少数据。答案是都省不到零。
06
数据主权与议价结构
五个环节里谁说话算数。造机器人的公司拿下 74.1% 出货,却只分到 12.8% 融资。
07
活法一 · 大厂全栈派
蚂蚁灵波、Google DeepMind、NVIDIA、字节、阿里、腾讯、华为的不同下注方式。
08
活法二 · 独立大脑派
自变量、它石、千寻、星海图、智平方、Physical Intelligence。以及两个国际先例。
09
活法三 · 本体自研派
宇树、智元、银河通用、优必选、Figure。「模型能装上某款机器人」不等于「量产真用它」。
10
商业模式与经济性
五种赚钱方式各有多硬的付费证据。以及一位物流巨头 CEO 在财报会上说的实话。
11
资本定价与估值叙事
200 亿俱乐部的边界争议、宇树 IPO 的定价锚、以及泡沫论的双方证据。
12
三个未解分歧
整条推理最脆弱的地方。每个分歧都列出正反双方的一手证据。
13
术语词典
每个术语给定义、大白话和类比。含全部口径声明与方法论。
从这里开始 第 01 章要回答:为什么 2026 年整个行业的焦点从「造出机器人」转向了「机器人的大脑」? 这个转向不是叙事偏好,而是有出货数据和资本流向支撑的结构性变化。
J 下一章 · K 上一章 · 「/」搜索术语
具身大脑产业系统性图谱 · 数据截至 2026 年 8 月
面壁智能 · 首席科学家助理 · 内部研究材料
全部数字均标注来源与证据等级;方法论与口径声明见第 13 章。