Chapter 05 · The Data Wall

数据墙与绕墙尝试

训练语言模型的文字可以从互联网上抓,训练图像模型的图片也可以。 但训练机器人需要的数据是「这一帧画面下,手臂各个关节该转多少度」—— 互联网上没有这种数据,只能让真机器人在真实场景里一次一次做,一条一条录下来。 这就是行业说的「数据墙」:又慢又贵,还必须自己动手。

行业提出过三条省事的办法:在电脑仿真环境里练、让机器人看人类干活的视频、 用世界模型自己生成练习数据。这一章把三条路的一手证据放在一起看, 结论一致:它们都能把要采的真机数据压小,但都压不到零。

上一章的结论 现有的能力成绩不能横向比:没有统考、最常用的考试已经没有区分度、延迟测法各异、也没有第三方裁判。 唯一还可信的指标是机器人在真实场景里连续无人干预干了多久,而这项能力靠真机数据喂出来。 这一章就看采这些数据到底有多贵。

墙有多高:从 350 小时到 20 万小时

先说一个容易被误读的地方:行业里的「百万级数据」通常指 轨迹条数(一条轨迹 = 一次完整动作演示),不是小时数。 智元 AgiBot World 的 100 万条轨迹对应的是 2,976.4 小时。 两个单位差了约 300 倍,混用会严重误判规模。

真机数据规模 · 对数刻度(小时) 深色 = 公开数据集 中色 = 公司自采(论文/官方) 浅色 = 公司自述,未经第三方核实 100 1,000 1 万 10 万 100 万 GR00T N1 真机部分 88 h 另有 78 万条仿真轨迹,官方折算「相当于 6,500 h」 DROID 350 h 76k 轨迹 星海图 Open-World 500 h 150 任务 深圳 LET / RoboMIND V2 约 1,000 h(开源) 智元 AgiBot World 2,976.4 h = 100 万条轨迹 π0 自采 约 1 万 h 7 构型 68 任务 蚂蚁灵波 VLA 2.0 6 万 h(5 万真机 + 1 万人类第一视角) 千寻智能 累计 20 万 h(公司自述) 面壁 MiniCPM-Robot:真机数据规模未公开披露——无法在此图中定位。
规模跨度接近三个数量级。 公开数据集最大约 3,000 小时,而头部公司自采已达 6 万至 20 万小时量级。 注意单位陷阱:AgiBot World 的「百万」指轨迹条数,对应小时数为 2,976.4。 灵波的 6 万小时有论文级清洗明细(原始约 9 万小时真机筛至 5 万,淘汰率约 44%), 千寻的 20 万小时是公司口径,且包含互联网视频、遥操作、可穿戴采集三类,不是 20 万小时真机数据,不能与灵波的 5 万小时真机或 π0 的 1 万小时真机直接并列。 一手 部分自述
规模不是唯一变量,密度和质检同样关键

灵波公布了一个少见的细节:原始采集约 9 万小时真机数据, 清洗后只保留 5 万小时(淘汰约 44%); 人类第一视角数据从 2 万小时筛到 1 万小时(淘汰 50%)。 接近一半的数据被自己丢掉了。 这说明「有多少小时」和「有多少可用小时」是两个数字, 而公开宣称通常给的是前者。

墙有多贵

这是本次调研中一手证据最薄弱的部分,必须明确标注等级。

口径价格来源性质
高质量数据全负载成本$118–200 / 有效小时行业估算站,非审计
简单二维任务$15–30 / 小时行业估算站
美国简单抓放$6–11 / 条演示商业博客
美国双臂 / 灵巧任务$54–157 / 条演示商业博客
中国真机数据市场售价500–1000 元 / 小时觅蜂科技姚卯青口径,经澎湃新闻报道
付给采集员的时薪(同源调查)约 30 元 / 小时36氪调查 中间商加价后卖 300–500 元/小时
熟练操作员产出30–60 条可用演示 / 小时商业博客
必须说明的三项缺失

调研后确认,以下三项没有可靠公开来源,本图谱不给出数字: ① 中国本土「元 / 有效小时」的分项成本拆解(人力、场地、设备折旧、后处理); ② Physical Intelligence 的官方采集成本(网上流传的 $45/小时只有二手站点,无 PI 官方来源); ③ DROID 项目的总投入金额。
另外,某行业估算站声称「CMU/Stanford 发现 40% 合成 + 60% 真机 = 100% 真机效果」, 经检索无法追溯到原始论文,本图谱不采用。

绕墙路径一 · 仿真:能放大,但不能替代

仿真的吸引力显而易见:不要真机、不要人、可以并行几千个环境。 RoboTwin 2.0 给出了目前最强的正面证据。

正面证据

  • 纯合成数据零样本迁移带来 228% 相对增益
  • 合成数据 + 仅 10 条真机演示,相对增益达 367%
  • 数据集规模超 10 万条双臂轨迹,成本远低于真机

arXiv:2506.18088 一手

决定性反证

Sim-and-Real Cotraining 研究基于 50 多个策略的系统实验, 结论写得非常直接:仿真数据无法替代真机数据。

机制解释也清楚:仿真数据的 scaling 会触顶(plateau), 而真机数据提升的是性能天花板本身。两者作用不同,不可互换。

arXiv:2503.22634 一手

另一个提示:RoboTwin 2.0 的 Hard 模式远未被攻克—— RDT 仅 13.7%、π0 仅 16.3%、DP3 仅 1.7%。 仿真里的「难」和真实世界的「难」还不是同一件事。

类比:仿真像游戏里的练习模式。 练完再打 10 场实战,远胜只打 10 场实战;但练习模式打再多也有上限,突破还得靠实战。

绕墙路径二 · 人类视频与可穿戴设备

思路是:人类做家务的视频几乎无限,能否让机器人从「看人干活」中学会干活? 2026 年这条路径出现了最强的一批证据,也暴露了最清楚的边界。

HumanScale 关键实验 · 5000 小时预训练规模 用人类第一视角数据预训练 同规模下验证损失比真机预训练低约 20% 真机成功率 +52.5 / +90 个百分点,但比较对象是「完全不预训练」 但——仍然必须用真机数据做后训练 人类视频提供的是「世界如何运作」的先验, 不包含机器人自己的关节与动力学映射。 Generalist AI 的极端案例 预训练使用超 50 万小时 可穿戴数据,零机器人数据 但每个新任务仍需约 1 小时机器人后训练——这个「1 小时」是无法被消除的部分
人类视频把真机需求从「大量」压到「少量」,但压不到零。 这是本章最重要的一组数字:即使用 50 万小时可穿戴数据预训练、完全不用机器人数据, 每个任务仍需约 1 小时真机后训练。
读这组数字要注意比较对象。HumanScale 的 +52.5 / +90 个百分点, 对照组是完全不做预训练的基线(40.0%→92.5%、0.0%→90.0%), 论文的真机实验里并没有设「用真机数据预训练」这一组。 真正与真机预训练同规模的对比只有验证损失一项,差距约 20%。 换句话说,这篇论文证明的是「人类视频预训练远好于不预训练」, 而不是「人类视频比真机数据更好」。 来源:arXiv:2606.20521(HumanScale)Table 2 与 §4.2–4.3、generalistai.com/blog/gen-1 一手

相关的效率证据也很强:UMI 方案用手持夹爪加相机, 约 30 秒就能采一条演示; Real2Render2Real 报告 1 次人类演示经渲染后约等于 150 次遥操作(单任务实验)。

类比:看全网烹饪视频能学到很多——场景极多且几乎免费, 但视频里没有你家灶台的坐标。看够多之后再在自家厨房练几次, 反而比一开始就在自家厨房反复采集更会举一反三。

绕墙路径三 · 世界模型:最被寄望,证据最弱

第 03 章已列出主要工作。这里只补充判断所需的反方一手证据。

声称反方一手证据
世界模型可替代机器人预训练
1X, 2026-01
TechCrunch 实测报道:实际仅完成取空气炸锅篮、放吐司、击掌等基础动作 转述
可交互世界生成已足够真实
Genie 3
官方 limitation 自承:无法精确模拟真实地理、多智能体交互困难、交互仅数分钟; 无任何机器人操作基准 一手
28B 世界模拟器可支撑训练
LingBot-World
官方自承:长时漂移、需企业级 GPU、精细操控能力有限 一手
失败后在线更新参数、自我进化
自变量 WALL-B
仅媒体报道,未找到 arXiv、技术报告或任何基准数字; 其私有术语「WUM」未被 2026-05 的 WAM 综述收录 未证实
生成数据可大比例替代采集
华为主张 80% 生成 + 20% 采集
NVIDIA 自身对同类技术的定位是「预训练想象,微调行动」—— 即生成用于预训练,真机用于微调 一手

类比:世界模型像飞行模拟器。区别在于飞行模拟器背后有精确的气动方程, 而学出来的世界模型,它的「物理定律」是猜出来的。 猜得像不代表猜得准——尤其在接触力这类最关键的地方。

三条路径合起来看:结论是一致的

三条绕墙路径,同一个终点 仿真 228% → 367% 增益,但 scaling 会触顶 仍需真机 人类视频 50 万小时预训练即可大幅提升域外表现 每任务 1 h 世界模型 游戏域最远,物理操作最保守 仍需真机 三条路都能把真机需求从「大量」压到「少量」,但都压不到零。 于是「谁拥有真机数据」从工程问题变成了产业结构问题。
这是本图谱的枢纽判断。 如果任何一条绕墙路径能真正替代真机数据,那么具身大脑就是一个纯算法竞赛, 拼的是模型能力和算力。 但既然三条路都需要真机数据兜底,那么能持续拿到真机数据的一方,就掌握了别人无法用算法补齐的资产。 数据由此从成本项变成主权项。

一个反向的补充证据:数据不只是越多越好

第 03 章提到的跨本体负迁移在这里有产业含义: 只用 OXE 数据训练成功率 77.3%,加入更多末端执行器数据后降到 72.1%。 同时,智元用 236 小时精心组织的数据在部分任务上超过了用 OXE 约 2000 小时的效果。

所以数据主权不等于数据堆量,而包含三件事: 能持续采集、能判断哪些该留(灵波丢掉 44%)、能按构型正确配比。 这三件事都需要长期投入和真实场景,因此不容易被资本快速追平。

治理层面:谁定标准,谁掌握准入

这一章要交出的结论

各家手里的数据量差了将近一千倍: 谁都能下载的公开数据集约 3,000 小时,而头部公司自己采了 6 万到 20 万小时。 采集成本目前没有可信的中国本土账目可查,只知道一件事—— 采回来的数据有将近一半会被自己判为不合格丢掉(蚂蚁灵波淘汰率 44%)。

三条省事的办法都能把真机采集量从「大量」压到「少量」,但没有一条能压到零: 仿真环境的开发者自己在论文里写明「无法替代真机」; 靠人类视频起步的方案,每个新任务仍然需要约 1 小时真机数据兜底; 世界模型在物理操作上是三者中最不成熟的。
所以真机数据是这个产业里唯一买不到、也补不齐的东西—— 它只能靠长期待在真实场景里一点点攒出来。后面几章会反复用到这个结论。

因此下一章要回答 第 06 章:既然真机数据这么关键,那它现在攥在谁手里? 从芯片、数据、模型、机器人本体到落地场景这五个环节,谁最有资格谈条件? 答案能解释一个看起来自相矛盾的现象—— 造机器人的公司拿下了全球 74.1% 的出货量,却只分到 12.8% 的融资,比卖零部件的还少。
05 / 13
本章数字来源:droid-dataset.github.io、arXiv:2503.06669(AgiBot World)、 arXiv:2607.06403(LingBot-VLA 2.0)、arXiv:2410.24164(π0)、spirit-ai.com、 arXiv:2506.18088(RoboTwin 2.0)、arXiv:2503.22634(Sim-and-Real Cotraining)、 arXiv:2606.20521(HumanScale)、generalistai.com、umi-gripper.github.io、 PMLR v305(Real2Render2Real)、arXiv:2602.09722、新华网标准报道、TechCrunch。
成本数据均来自行业估算站与商业博客,非审计来源,已在表中标注等级。 单位口径(轨迹 / 小时 / 帧)已逐条区分。