活法一 · 大厂全栈派
蚂蚁、Google、NVIDIA、华为都明确表示自己不造机器人身体。 他们的做法是把模型免费开源给机器人厂用,同时用投资绑定一批本体公司, 再从这些合作方那里拿回真机数据。
换句话说,他们想成为的是机器人行业的「安卓」: 身体谁造都行,但里面那套软件得是我的。 这一章看七家大厂各自下注的方式,以及这套循环里最薄弱的一环在哪。
为什么大厂选择不造本体
逻辑很直接:本体已经过剩(工商口径 680 家 / 监管口径 140 余家整机企业、2025 年 TOP6 占 74.1% 出货、供给倾向过剩 转述), 造身体既不稀缺也不赚钱。而大厂真正的优势是三样别人没有的东西—— 足够深的资本、可用于数据采集的真实业务场景、以及能吸引本体厂主动接入的生态位。
这个飞轮的脆弱点在第 2 步:数据供给依赖合作伙伴的意愿。 第 06 章已说明,这一点尚未在国内被证伪,但 Figure 与 Covariant 两个国际先例正是在这里断裂的。
蚂蚁灵波(Ant Robbyant):目前最完整的全栈下注
是本次调研中产品矩阵最完整、一手技术材料最充分的全栈玩家。 六款模型覆盖从感知到世界模型的全链条: LingBot-Depth 2.0(深度感知)、Vision、VLA 2.0(操作)、World 2.0(世界模型)、Video、VA 2.0。
- 技术路线
- VLA 与 VA(世界动作模型)双线并行。沈宇军的判断: 未来不是 VLA 或 VA 单独赢,会走向融合。主张「具身原生」,不从数字世界模型微调而来。
- 数据规模
- 6 万小时(5 万真机 + 1 万人类第一视角), 覆盖 20 种机器人构型。原始采集约 9 万小时,淘汰约 44%。 一手
- 关键指标
- RoboTwin 2.0 Clean 93.52% / Randomized 92.80% 一手; GM-100 真机基准平均成功率 17.30%(π0.5 为 13.02%、GR00T N1.6 为 7.59%)—— 竞品数字由灵波自行复现 部分自述
- 开放程度
- 权重与代码公开,Apache-2.0,可商用
- 本体立场
- 自研 R-2 用于验证,但朱兴明确表示不押注本体、在硬件之间保持中立, 并承认落地仍处早期
LingBot-Depth 2.0 嵌入奥比中光 Gemini 330 系列相机(该公司在中国服务机器人 3D 视觉市占超 70%)。 这等于绕过整机厂,直接在「眼睛」这一层建立位置。 如果本体厂未来收紧数据供给,传感器这条路径不受影响——这是一个对冲设计。
灵波不报告 LIBERO、CALVIN、RMBench, 论文与 README 也未给出总参数量(代码仓库名含 6b,但不能当作论文确认值)。 这使它与面壁等模型的可比轴只剩 RoboTwin 与开放许可两项——第 04 章已说明这一限制。
Google DeepMind:不造硬件的大脑供应商
七家里定位最单纯的一家:只做大脑、不碰硬件、也不开源,靠卖能力赚钱。 它是全球唯一同时拥有顶级视觉语言模型和长期机器人研究积累的机构。
- 产品结构
- Gemini Robotics 2(全身 VLA)+ ER 2(基于 Gemini 3.5 Flash 的推理与进展评估,128k 上下文)+ On-Device 2(端侧版)
- 合作本体
- Apptronik Apollo 2(旗舰平台)、Franka Duo + Robotiq、Dexmate、Trossen、SO101
- 适配效率
- On-Device 2 声称 少于 200 个样本、数小时即可适配新本体—— 官方博客表述,无第三方复现 未证实
- 开放程度
- ER 2 已在 AI Studio 开放;VLA 与 On-Device 为 early access / waitlist; 权重闭源
NVIDIA:卖铲子的人同时开源了地图
唯一同时提供芯片(Jetson Thor / Orin)+ 仿真(Isaac Lab)+ 世界模型(Cosmos)+ 开源基座(GR00T) 的玩家。开源基座的商业目的很清楚:让所有人的机器人都跑在自己的芯片上。
- 模型演进
- N1-2B(2.2B)→ N1.5/N1.6/N1.7(3B);N1.6 起换用 Cosmos-Reason-2B 作为慢层
- 数据构成
- N1 阶段真机只有 88 小时(傅利叶 GR-1 平台),
经视频生成扩到 827 小时神经轨迹——后者是合成数据,不是真机采集。
另有 78 万条仿真轨迹,NVIDIA 官方博客把它折算为「相当于 6,500 小时」人类演示,
原文用的是 equivalent to,属折算值而非直接计量。
N1.7 报的是约 3.2 万小时「真实演示 + 以人类为中心的数据」, 其中约 2.08 万小时 EgoScale 人类视频是包含在这 3.2 万里的,不能再加一次 - 公开指标
- LIBERO 四分项 97.65 / 97.5 / 98.45,但 Long 子集只有 94.35; SimplerEnv Bridge 62.07% / Fractal 67.66%; Jetson Thor + TensorRT 下 92 ms(10.9 Hz,4 步去噪)一手
- 训练集含哪些本体
- N1 论文明确列出傅利叶 GR-1(遥操作)与 AgiBot-Alpha 等; 宇树 G1 出现的位置是 N1.7 的部署适配标签,不等于预训练数据来源。 流传的「宇树 G1 + 智元 Genie-1 + 傅利叶 GR-1」三连未找到 NVIDIA 一手表述, 本图谱不采用一手
注意一个细节:NVIDIA 对世界模型的官方定位是 「预训练用于想象,微调用于行动」—— 连最有动机推销生成式方案的公司,也没有声称生成数据可以替代真机。
中国其他大厂:下注方式差异很大
字节跳动 Seed
GR-3 为 4B 参数(Qwen2.5-VL-3B + 动作 DiT),配套自研 ByteMini 本体(22 自由度)。 未见物体成功率经 10 条人类轨迹后从 57.8% 升至 86.7%。一手
披露特点:只报真机任务级数据,不报任何标准仿真基准,权重未开源。 2026 年的大规模商业合作未找到公开来源。
阿里巴巴
Qwen-Robot 覆盖 RobotManip / Nav / World;高德发布 ABot-M0/N0(2026-02-12)。
特点:投资布局极广——逐际动力、星动纪元、宇树、自变量、星海图、灵心巧手。 用资本覆盖不确定性,而非押单一路线。
腾讯
Hy-Embodied-VLM-1.0 / RxBrain-1.0 / VLA-0.5,其中 VLA-0.5 用超 1 万小时 UMI 人类示教数据。 张正友的原话是「今天的人工智能是『缸中之脑』」—— 按原文他说的是「人工智能」而非「大模型」、「今天」而非「此前」。
特点:走人类示教数据路线,避开真机采集成本。
华为
明确不造机器人本体。以 CloudRobo 平台 + 盘古 5.5 + R2C 协议切入。
争议主张:80% 数据生成 + 20% 采集 未证实。 这个比例指的是样本条数占比,不是训练贡献占比——两者容易被混读。 即便按条数理解,第 05 章的一手证据也不支持这个替代率:仿真明确「无法替代」真机。
京东
JoyInside「附身智能」偏交互层而非 VLA 操作栈; JoyAI-RA / EgoLive / JoyAI-Sim 构成数据设施。计划两年积累 1000 万小时人类场景视频—— 属规划目标,非已完成量 未证实。
特点:用零售与物流场景换数据,是「场景即数据」的典型。
美团 / Meta / Tesla / OpenAI
美团:投资 + 场景为主,是宇树最大外部股东(约 9.65%
转述),自研 VLA 未找到。
Meta:2026-05-01 收购 Assured Robot Intelligence,有 V-JEPA 2,
CTO Bosworth 被转述为认为软件而非硬件是当前瓶颈
原话逐字表述未能核到,此处按大意转述 转述,
但正式具身 VLA 产品名未找到。
Tesla:Optimus 与 FSD 共享统一架构,AI5 芯片 2026-04 完成 tape out,
但 Q2 2026 股东信删除了 volume production 表述。
OpenAI:2026-05-31 重启内部 Robotics 团队,公开具身基座模型未找到。
这一派的共同问题
结构性优势
- 资本深度足以承受长周期
- 自有业务场景可用于数据采集(京东零售、蚂蚁支付场景)
- 开源可换取本体厂主动接入,成本极低
- 不押注本体,避免了硬件过剩的风险
结构性风险
- 数据供给依赖合作伙伴意愿——飞轮的第 2 步不在自己手里
- 开源目前没有一家产生公开的模型授权收入
- 大厂内部优先级可能变化,机器人非核心业务
- 朱兴自己也承认:落地仍处早期
这一派统一的做法是不造身体,只做那套所有身体都要装的软件: 把模型免费开源出去换取更多机器人厂适配,再从这些合作方手里拿回真机数据。
蚂蚁灵波是七家里做得最全的一家: 模型已适配 20 款不同构造的机器人、手里有 6 万小时真机数据、 用的是允许商用的 Apache-2.0 许可证。 它还多留了一手——把自己的传感器嵌进机器人硬件里,这样即便本体厂将来自研大脑, 数据也仍会经过蚂蚁的部件。 Google 走的是另一种:模型不开源,只卖能力; NVIDIA 则干脆两边都不站,谁做机器人都得买它的芯片。
但这套循环里有一个环节不在自己手上:真机数据得靠合作伙伴帮忙采。 那么,自己把采集队伍建起来的公司,情况会不一样吗?
标注「未找到」的项目均经检索确认无公开来源,非遗漏。