数据墙与绕墙尝试
训练语言模型的文字可以从互联网上抓,训练图像模型的图片也可以。 但训练机器人需要的数据是「这一帧画面下,手臂各个关节该转多少度」—— 互联网上没有这种数据,只能让真机器人在真实场景里一次一次做,一条一条录下来。 这就是行业说的「数据墙」:又慢又贵,还必须自己动手。
行业提出过三条省事的办法:在电脑仿真环境里练、让机器人看人类干活的视频、 用世界模型自己生成练习数据。这一章把三条路的一手证据放在一起看, 结论一致:它们都能把要采的真机数据压小,但都压不到零。
墙有多高:从 350 小时到 20 万小时
先说一个容易被误读的地方:行业里的「百万级数据」通常指 轨迹条数(一条轨迹 = 一次完整动作演示),不是小时数。 智元 AgiBot World 的 100 万条轨迹对应的是 2,976.4 小时。 两个单位差了约 300 倍,混用会严重误判规模。
灵波公布了一个少见的细节:原始采集约 9 万小时真机数据, 清洗后只保留 5 万小时(淘汰约 44%); 人类第一视角数据从 2 万小时筛到 1 万小时(淘汰 50%)。 接近一半的数据被自己丢掉了。 这说明「有多少小时」和「有多少可用小时」是两个数字, 而公开宣称通常给的是前者。
墙有多贵
这是本次调研中一手证据最薄弱的部分,必须明确标注等级。
| 口径 | 价格 | 来源性质 |
|---|---|---|
| 高质量数据全负载成本 | $118–200 / 有效小时 | 行业估算站,非审计 |
| 简单二维任务 | $15–30 / 小时 | 行业估算站 |
| 美国简单抓放 | $6–11 / 条演示 | 商业博客 |
| 美国双臂 / 灵巧任务 | $54–157 / 条演示 | 商业博客 |
| 中国真机数据市场售价 | 500–1000 元 / 小时 | 觅蜂科技姚卯青口径,经澎湃新闻报道 |
| 付给采集员的时薪(同源调查) | 约 30 元 / 小时 | 36氪调查 中间商加价后卖 300–500 元/小时 |
| 熟练操作员产出 | 30–60 条可用演示 / 小时 | 商业博客 |
调研后确认,以下三项没有可靠公开来源,本图谱不给出数字:
① 中国本土「元 / 有效小时」的分项成本拆解(人力、场地、设备折旧、后处理);
② Physical Intelligence 的官方采集成本(网上流传的 $45/小时只有二手站点,无 PI 官方来源);
③ DROID 项目的总投入金额。
另外,某行业估算站声称「CMU/Stanford 发现 40% 合成 + 60% 真机 = 100% 真机效果」,
经检索无法追溯到原始论文,本图谱不采用。
绕墙路径一 · 仿真:能放大,但不能替代
仿真的吸引力显而易见:不要真机、不要人、可以并行几千个环境。 RoboTwin 2.0 给出了目前最强的正面证据。
正面证据
- 纯合成数据零样本迁移带来 228% 相对增益
- 合成数据 + 仅 10 条真机演示,相对增益达 367%
- 数据集规模超 10 万条双臂轨迹,成本远低于真机
arXiv:2506.18088 一手
决定性反证
Sim-and-Real Cotraining 研究基于 50 多个策略的系统实验, 结论写得非常直接:仿真数据无法替代真机数据。
机制解释也清楚:仿真数据的 scaling 会触顶(plateau), 而真机数据提升的是性能天花板本身。两者作用不同,不可互换。
arXiv:2503.22634 一手
另一个提示:RoboTwin 2.0 的 Hard 模式远未被攻克—— RDT 仅 13.7%、π0 仅 16.3%、DP3 仅 1.7%。 仿真里的「难」和真实世界的「难」还不是同一件事。
类比:仿真像游戏里的练习模式。 练完再打 10 场实战,远胜只打 10 场实战;但练习模式打再多也有上限,突破还得靠实战。
绕墙路径二 · 人类视频与可穿戴设备
思路是:人类做家务的视频几乎无限,能否让机器人从「看人干活」中学会干活? 2026 年这条路径出现了最强的一批证据,也暴露了最清楚的边界。
读这组数字要注意比较对象。HumanScale 的 +52.5 / +90 个百分点, 对照组是完全不做预训练的基线(40.0%→92.5%、0.0%→90.0%), 论文的真机实验里并没有设「用真机数据预训练」这一组。 真正与真机预训练同规模的对比只有验证损失一项,差距约 20%。 换句话说,这篇论文证明的是「人类视频预训练远好于不预训练」, 而不是「人类视频比真机数据更好」。 来源:arXiv:2606.20521(HumanScale)Table 2 与 §4.2–4.3、generalistai.com/blog/gen-1 一手
相关的效率证据也很强:UMI 方案用手持夹爪加相机, 约 30 秒就能采一条演示; Real2Render2Real 报告 1 次人类演示经渲染后约等于 150 次遥操作(单任务实验)。
类比:看全网烹饪视频能学到很多——场景极多且几乎免费, 但视频里没有你家灶台的坐标。看够多之后再在自家厨房练几次, 反而比一开始就在自家厨房反复采集更会举一反三。
绕墙路径三 · 世界模型:最被寄望,证据最弱
第 03 章已列出主要工作。这里只补充判断所需的反方一手证据。
| 声称 | 反方一手证据 |
|---|---|
| 世界模型可替代机器人预训练 1X, 2026-01 |
TechCrunch 实测报道:实际仅完成取空气炸锅篮、放吐司、击掌等基础动作 转述 |
| 可交互世界生成已足够真实 Genie 3 |
官方 limitation 自承:无法精确模拟真实地理、多智能体交互困难、交互仅数分钟; 无任何机器人操作基准 一手 |
| 28B 世界模拟器可支撑训练 LingBot-World |
官方自承:长时漂移、需企业级 GPU、精细操控能力有限 一手 |
| 失败后在线更新参数、自我进化 自变量 WALL-B |
仅媒体报道,未找到 arXiv、技术报告或任何基准数字; 其私有术语「WUM」未被 2026-05 的 WAM 综述收录 未证实 |
| 生成数据可大比例替代采集 华为主张 80% 生成 + 20% 采集 |
NVIDIA 自身对同类技术的定位是「预训练想象,微调行动」—— 即生成用于预训练,真机用于微调 一手 |
类比:世界模型像飞行模拟器。区别在于飞行模拟器背后有精确的气动方程, 而学出来的世界模型,它的「物理定律」是猜出来的。 猜得像不代表猜得准——尤其在接触力这类最关键的地方。
三条路径合起来看:结论是一致的
一个反向的补充证据:数据不只是越多越好
第 03 章提到的跨本体负迁移在这里有产业含义: 只用 OXE 数据训练成功率 77.3%,加入更多末端执行器数据后降到 72.1%。 同时,智元用 236 小时精心组织的数据在部分任务上超过了用 OXE 约 2000 小时的效果。
所以数据主权不等于数据堆量,而包含三件事: 能持续采集、能判断哪些该留(灵波丢掉 44%)、能按构型正确配比。 这三件事都需要长期投入和真实场景,因此不容易被资本快速追平。
治理层面:谁定标准,谁掌握准入
- 数据质量八个维度(完整性、一致性、多样性、真实性、易用性、实用性、可扩展性、安全性)已写入标准,2026-11-01 实施
这是工信部批准的通信行业标准 YD/T 6771-2026,不是国家标准(GB/T)。行业标准的约束力和适用范围都窄一层 - 工信部 TC8 标委会具身智能 WG7 数据工作组 于 2026-07 成立
- 国家地方共建人形机器人创新中心牵头首个「第一视角」实景数据研究联盟(2026-06-17)。常被一起引用的「120 余家成员」实际属于同场大会上的人形机器人产业创新联盟(母联盟),新联盟自身的成员总数未披露
- 失败数据同样有价值:智元保留约 1% 的失败恢复轨迹用于反思训练; RoboMIND V1 含 5,000 条失败演示并标注失败原因
各家手里的数据量差了将近一千倍: 谁都能下载的公开数据集约 3,000 小时,而头部公司自己采了 6 万到 20 万小时。 采集成本目前没有可信的中国本土账目可查,只知道一件事—— 采回来的数据有将近一半会被自己判为不合格丢掉(蚂蚁灵波淘汰率 44%)。
三条省事的办法都能把真机采集量从「大量」压到「少量」,但没有一条能压到零:
仿真环境的开发者自己在论文里写明「无法替代真机」;
靠人类视频起步的方案,每个新任务仍然需要约 1 小时真机数据兜底;
世界模型在物理操作上是三者中最不成熟的。
所以真机数据是这个产业里唯一买不到、也补不齐的东西——
它只能靠长期待在真实场景里一点点攒出来。后面几章会反复用到这个结论。
成本数据均来自行业估算站与商业博客,非审计来源,已在表中标注等级。 单位口径(轨迹 / 小时 / 帧)已逐条区分。