Chapter 01 · Focus Shift

焦点为何转向大脑

2026 年,人形机器人的身体已经能造、能卖、能赚钱了。 但买家主要是学校和研究机构,不是要它干活的工厂。 这个错位说明卡住产业的不再是硬件,而是让身体知道该做什么的那部分

上一章的结论 总览提出:这份图谱是一条因果链,起点是物理世界的三道约束。 但在讲约束之前,需要先确认一件事——为什么值得花整份图谱去研究「大脑」,而不是研究本体、电机或减速器?

硬件这一关,已经过了

判断一个硬件品类是否成熟,最直接的指标是有没有公司靠它规模化盈利。 宇树科技 2026 年 8 月在科创板上市,招股意向书给出的数字回答了这个问题。

16.99 亿元
宇树 2025 年营收(2023 年为 1.59 亿)
招股意向书 一手
5.91 亿元
2025 年扣非净利润——已实现规模化盈利
招股意向书 一手
60.1%
毛利率,接近优质软件公司水平
招股意向书 一手
5,500
2025 年人形机器人出货量
招股意向书 一手

这不是孤例。2026 年上半年全球人形机器人出货约 1.91 万台, 同比增长近三倍,中国厂商占 97% 以上。 其中智元首次超过宇树,出货 8,400 台占全球 44%,宇树 5,900 台。 Smart Analytics Global 2026-08-11,经格隆汇 转述 再往前看一年,2025 年全年出货前六名——宇树、智元、乐聚、加速进化、松延、优必选—— 合计占全球 74.1%赛迪出版传媒 × 中国电子报《2025 年人形机器人市场研究报告》 转述 (这两组数字分属 2026 上半年与 2025 全年,不同统计方、不同区间,不要当成同一口径叠加。)

换句话说,造出一台能走、能动、能量产的人形机器人,在 2026 年已经不是技术壁垒。 供给甚至开始过剩,不过「有多少家在造」这件事本身就有两个差很远的口径: 工商登记类统计给出约 680 家人形机器人企业,被业内形容为「99% 陪跑」; 而工信部等部门的监管口径只认140 余家整机企业。 差了近五倍,原因是前者把广义相关企业都算进去了。本图谱两个都列,不合并。 启信宝《具身智能全景洞察》2026-05;工信部/国新办 2026 年初口径 转述

但买家不是用它干活的人

如果硬件成熟意味着产业成熟,那么出货量增长应该伴随工业客户增加。 实际的客户结构指向相反的方向。

宇树 2025 年前三季度 · 人形机器人收入构成 科研教育 73.6% 高校实验室、研究机构采购——买去做研究,不是做生产 商业消费 17.4% 展示、导览、活动租赁——本质是内容与流量场景 行业应用 9.0% 真正进入生产流程的部分,不足十分之一 来源:宇树科技招股意向书(2026-07-31 披露)
硬件卖得好,但主要卖给了研究者。 科研教育占收入 73.6%,真正进入工业生产流程的行业应用不足 9%。 这个结构说明:客户为「一台能动的机器人」付钱,但还没有为「一台能干活的机器人」付钱。 一手 · 监管文件

全国招采数据指向同一结论。2025 年春节后至 2026 年 6 月底, 可统计的人形机器人采购项目 302 个、金额 18.38 亿元; 其中学校占了 68% 的项目数量,国有单位占了 74% 的金额虎嗅独立统计 转述

这个错位说明了什么

一台机器人如果只需要「能动」,硬件就够了。 但要它在工厂里替代人力、在药房里拣货、在家里做家务, 它必须自己判断该抓哪个、抓歪了怎么办、这一步做完下一步是什么。 付费意愿卡在这一层,而这一层属于大脑。

连造身体的人自己也这么说

最有说服力的证据不是分析师判断,而是硬件公司创始人自己的表态—— 毕竟指出「瓶颈在软件」对一家卖硬件的公司并无好处。

王兴兴 · 宇树科技创始人 · 2025 世界机器人大会(2025-08)

据科学网报道,他在会上判断当前的瓶颈在模型能力,而不在数据

引用规范说明:这是间接引述,不是逐字原话。 而且必须补上同场的另一半——他在同一场演讲里也提到了数据不足的问题。 单独摘出「是模型问题不是数据问题」,会把他的立场说得比实际更绝对。 科学网 2025-08 转述

更硬的证据来自监管文件而不是发言:宇树 IPO 募集资金中约一半投向模型研发。 招股书同时承认,公司的 WMA 与 VLA 两条路线仍在并行研发测试, 尚未规模化部署自研的通用具身大模型,目前只在自有工厂试点。 招股意向书 一手

一家已经靠卖硬件实现 5.91 亿元扣非净利润的公司, 把上市募资的一半投向自己还没跑通的模型,并公开说这是「最大阻碍」。 这比任何行业报告都更能说明焦点在哪。

资本已经先走了一步

如果焦点真的从身体转向大脑,那么钱的流向应该能看出来。 统计确实印证了这个判断,而且差距比预想的更悬殊

2026 上半年中国具身智能融资 · 约 438 亿元的去向 只画统计方原文能追溯到的三项。大脑派的具体金额与百分比,统计方原文没有给。 大脑与模型 「超过一半」 统计方只给了定性表述 零部件 14.4% 纯本体制造 12.8% 低于零部件——造身体的公司拿到的钱最少 统计方唯一给出的技术路线量化:35 家有融资动态的大脑派公司中,27 家在研发世界模型(近八成)。 注意这是公司数量占比,不是资金占比。 来源:量子位不完全统计(2026-06,截至 6 月 12 日,仅含已披露金额)。非审计数据。
资本对「大脑」的下注远超「本体」,但精确到小数点的那个版本不可信。 纯本体制造拿到的融资比例(12.8%)甚至低于零部件(14.4%),这两个数字出自统计方原文,可追溯。 但广为流传的「大脑派 222.53 亿元、占比 50.8%」在统计方原文里并不存在—— 原文只写「超过一半」,那两个精确数字首见于二次撰写稿,无法确认是转写者自行计算还是拿到了未公开明细。 本图谱因此只保留可追溯的部分。同理,流传的「VLA 42% / 世界模型 27% / 数据基础设施 20% / 端侧芯片 11%」 四项资金拆分在任何统计方原文中都找不到,且四项相加恰为 100%、不含「其他」,已整组剔除。 口径另需注意:438 亿是「截至 6 月 12 日」而非完整上半年; 同期 IT桔子给出「288 起 / 超 460 亿元」(披露口径)与「322 笔 / 934.74 亿元」(含估算的全量口径)两套, 后者不可与前者并列比较。转述 · 非审计

那么,「大脑」到底指什么

行业里「具身大脑」通常指 VLA 模型 (Vision-Language-Action,视觉-语言-动作模型)—— 一个接收摄像头画面和一句人类指令、直接输出机器人该怎么动的模型。 可以理解为机器人版的「看—听—做」一条龙:看一眼环境,听懂一句话,然后动手。

它和大语言模型的差别,不在参数量或架构,而在输出错了之后会发生什么

大语言模型

  • 输出是文字,错了可以重说
  • 没有硬性时间预算,多想几秒无妨
  • 训练数据可从互联网大规模抓取
  • 上下文长度是工程问题,可堆到百万 token
  • 评测有 MMLU 等相对公认的公共标尺

具身大脑

  • 输出是力和位移,错了杯子已经倒了
  • 每步决策必须在几十毫秒内完成
  • 动作数据无法从互联网获得,必须真机采集
  • 历史帧要占用宝贵的端侧算力与内存
  • 不存在非厂商主导的公认标尺

最后一条尤其重要,也是本图谱后续反复回到的问题: 截至 2026 年 8 月,具身智能领域不存在类似 MMLU 的第三方认证基准。 现有基准要么由发布模型的机构自己维护,要么已经被证明失效(第 04 章)。 这意味着「谁的大脑更强」这个问题,目前在技术上还没有公允的回答方式

这一章要交出的结论

焦点转向大脑不是因为这个词更时髦,而是有四条各自独立的证据:

一、身体已经能量产、也能赚钱——宇树营收 16.99 亿元、主营业务毛利率 60.13%, 硬件这一环不再是瓶颈。 二、但买家结构说明客户只为「会动」付钱、还没为「会干活」付钱: 科研和教育客户占了 73.6%,他们买回去是做研究和演示,不是让它上工。 三、做硬件的人自己把钱投向了软件——宇树 IPO 募资约一半投向模型研发, 同时在招股书里承认自研大模型尚未规模化部署。 四、钱已经先走了:资本投给大脑的金额是投给本体的约四倍。
而大脑之所以难做,根子在于它必须对物理世界负责。 下一章把这个「负责」拆成三件具体的事来量。

因此下一章要回答 第 02 章:物理世界对大脑的要求,具体硬到什么程度? 换个房间还得能干活、几十毫秒内出决策、记住几分钟前的事—— 这三件事各自的边界能用一手数据量出来, 而它们为什么不可能同时满足,决定了后面所有技术路线怎么妥协。
01 / 13
数据截至 2026 年 8 月。本章数字来源:宇树科技招股意向书(2026-07-31)、 量子位融资统计(2026-06,统计方原文)、IT桔子上半年口径、虎嗅招采统计、Smart Analytics 出货统计。
融资结构数字一律以统计方原文为准,二次撰写稿新增的精确数字不采用。
证据等级说明见第 13 章。融资与出货统计口径存在机构间差异,已在图注中标明。