焦点为何转向大脑
2026 年,人形机器人的身体已经能造、能卖、能赚钱了。 但买家主要是学校和研究机构,不是要它干活的工厂。 这个错位说明卡住产业的不再是硬件,而是让身体知道该做什么的那部分。
硬件这一关,已经过了
判断一个硬件品类是否成熟,最直接的指标是有没有公司靠它规模化盈利。 宇树科技 2026 年 8 月在科创板上市,招股意向书给出的数字回答了这个问题。
这不是孤例。2026 年上半年全球人形机器人出货约 1.91 万台, 同比增长近三倍,中国厂商占 97% 以上。 其中智元首次超过宇树,出货 8,400 台占全球 44%,宇树 5,900 台。 Smart Analytics Global 2026-08-11,经格隆汇 转述 再往前看一年,2025 年全年出货前六名——宇树、智元、乐聚、加速进化、松延、优必选—— 合计占全球 74.1%。 赛迪出版传媒 × 中国电子报《2025 年人形机器人市场研究报告》 转述 (这两组数字分属 2026 上半年与 2025 全年,不同统计方、不同区间,不要当成同一口径叠加。)
换句话说,造出一台能走、能动、能量产的人形机器人,在 2026 年已经不是技术壁垒。 供给甚至开始过剩,不过「有多少家在造」这件事本身就有两个差很远的口径: 工商登记类统计给出约 680 家人形机器人企业,被业内形容为「99% 陪跑」; 而工信部等部门的监管口径只认140 余家整机企业。 差了近五倍,原因是前者把广义相关企业都算进去了。本图谱两个都列,不合并。 启信宝《具身智能全景洞察》2026-05;工信部/国新办 2026 年初口径 转述
但买家不是用它干活的人
如果硬件成熟意味着产业成熟,那么出货量增长应该伴随工业客户增加。 实际的客户结构指向相反的方向。
全国招采数据指向同一结论。2025 年春节后至 2026 年 6 月底, 可统计的人形机器人采购项目 302 个、金额 18.38 亿元; 其中学校占了 68% 的项目数量,国有单位占了 74% 的金额。 虎嗅独立统计 转述
一台机器人如果只需要「能动」,硬件就够了。 但要它在工厂里替代人力、在药房里拣货、在家里做家务, 它必须自己判断该抓哪个、抓歪了怎么办、这一步做完下一步是什么。 付费意愿卡在这一层,而这一层属于大脑。
连造身体的人自己也这么说
最有说服力的证据不是分析师判断,而是硬件公司创始人自己的表态—— 毕竟指出「瓶颈在软件」对一家卖硬件的公司并无好处。
据科学网报道,他在会上判断当前的瓶颈在模型能力,而不在数据。
引用规范说明:这是间接引述,不是逐字原话。 而且必须补上同场的另一半——他在同一场演讲里也提到了数据不足的问题。 单独摘出「是模型问题不是数据问题」,会把他的立场说得比实际更绝对。 科学网 2025-08 转述
更硬的证据来自监管文件而不是发言:宇树 IPO 募集资金中约一半投向模型研发。 招股书同时承认,公司的 WMA 与 VLA 两条路线仍在并行研发测试, 尚未规模化部署自研的通用具身大模型,目前只在自有工厂试点。 招股意向书 一手
一家已经靠卖硬件实现 5.91 亿元扣非净利润的公司, 把上市募资的一半投向自己还没跑通的模型,并公开说这是「最大阻碍」。 这比任何行业报告都更能说明焦点在哪。
资本已经先走了一步
如果焦点真的从身体转向大脑,那么钱的流向应该能看出来。 统计确实印证了这个判断,而且差距比预想的更悬殊。
那么,「大脑」到底指什么
行业里「具身大脑」通常指 VLA 模型 (Vision-Language-Action,视觉-语言-动作模型)—— 一个接收摄像头画面和一句人类指令、直接输出机器人该怎么动的模型。 可以理解为机器人版的「看—听—做」一条龙:看一眼环境,听懂一句话,然后动手。
它和大语言模型的差别,不在参数量或架构,而在输出错了之后会发生什么。
大语言模型
- 输出是文字,错了可以重说
- 没有硬性时间预算,多想几秒无妨
- 训练数据可从互联网大规模抓取
- 上下文长度是工程问题,可堆到百万 token
- 评测有 MMLU 等相对公认的公共标尺
具身大脑
- 输出是力和位移,错了杯子已经倒了
- 每步决策必须在几十毫秒内完成
- 动作数据无法从互联网获得,必须真机采集
- 历史帧要占用宝贵的端侧算力与内存
- 不存在非厂商主导的公认标尺
最后一条尤其重要,也是本图谱后续反复回到的问题: 截至 2026 年 8 月,具身智能领域不存在类似 MMLU 的第三方认证基准。 现有基准要么由发布模型的机构自己维护,要么已经被证明失效(第 04 章)。 这意味着「谁的大脑更强」这个问题,目前在技术上还没有公允的回答方式。
焦点转向大脑不是因为这个词更时髦,而是有四条各自独立的证据:
一、身体已经能量产、也能赚钱——宇树营收 16.99 亿元、主营业务毛利率 60.13%,
硬件这一环不再是瓶颈。
二、但买家结构说明客户只为「会动」付钱、还没为「会干活」付钱:
科研和教育客户占了 73.6%,他们买回去是做研究和演示,不是让它上工。
三、做硬件的人自己把钱投向了软件——宇树 IPO 募资约一半投向模型研发,
同时在招股书里承认自研大模型尚未规模化部署。
四、钱已经先走了:资本投给大脑的金额是投给本体的约四倍。
而大脑之所以难做,根子在于它必须对物理世界负责。
下一章把这个「负责」拆成三件具体的事来量。
融资结构数字一律以统计方原文为准,二次撰写稿新增的精确数字不采用。
证据等级说明见第 13 章。融资与出货统计口径存在机构间差异,已在图注中标明。