模型能力对照
这一章原本要给出一张「各家大脑能力对比雷达图」。 做完数据采集后发现做不到,而做不到的原因本身比那张图更有价值: 不存在一场所有主流模型都参加的考试。
先看一个事实:谁参加了哪场考试
把主流模型公开报告过的基准列出来,会看到一个非常规整的模式。
| 模型 | LIBERO | CALVIN | RoboTwin 2.0 | RMBench | SimplerEnv | 真机基准 |
|---|---|---|---|---|---|---|
| 面壁 MiniCPM-RobotManip | 仅总分 | 4.1 | 91.3 / 91.6 | 53.3 | 未报告 | 未报告 |
| 蚂蚁 LingBot-VLA 2.0 | 未报告 | 未报告 | 93.52 / 92.80 | 未报告 | 未报告 | GM-100 |
| 星海图 G0.5 | 98.9 四分项 | 未报告 | 93.7 / 92.8 | 未报告 | 87.3 | BEHAVIOR-1K |
| 智元 GO-1 | 94.8 四分项 | 未报告 | 未报告 | 未报告 | 未报告 | 未报告 |
| 自变量 WALL-OSS-0.5 | 仅总分 96.5 | 未报告 | 未报告 | 未报告 | 未报告 | 17 任务 |
| π0.5 | 96.85 四分项 | 未报告 | 未报告 | 10.4(第三方测) | 未报告 | 未报告 |
| GR00T N1.6 | 97.5 四分项 | 未报告 | 未报告 | 未报告 | 62.07 / 67.66 | 未报告 |
| 字节 Seed GR-3 | 未报告 | 未报告 | 未报告 | 未报告 | 未报告 | 仅真机 |
| 北京人形 XR-1 | 未报告 | 未报告 | 未报告 | 未报告 | 未报告 | 14,000 rollouts |
| Figure Helix / Helix 02 | 未报告 | 未报告 | 未报告 | 未报告 | 未报告 | 零百分比公开 |
| Gemini Robotics 2 | 未报告 | 未报告 | 未报告 | 未报告 | 未报告 | 官方 blog 图 |
每家都在自己占优的赛场上报数。RMBench 全行业只有 3 个模型有分数—— 面壁 53.3、Mem-0 42.0、π0.5 10.4,其中只有面壁是主动选择这个赛场的厂商; 蚂蚁灵波完全不报 LIBERO;字节与北京人形不报任何标准仿真基准; Figure 至今没有公开过任何一个成功率百分比,只有视频。
直接后果:任何跨模型雷达图的形状,主要反映的是「谁选择公开什么」,而不是「谁能力更强」。 如果把 RMBench 做成雷达的一条轴,面壁会一枝独秀——但那不是因为面壁强, 而是因为只有面壁选了这个赛场。同理,LIBERO 轴会让不报 LIBERO 的灵波显示为空白, 看起来像弱项,实际是它选择不参加。
唯一站得住的能力雷达:头对头
多模型雷达画不出来,但有一种雷达是成立的: 当同一方用同一套口径测量了两个模型时,这两个模型之间可以比。 面壁的 README 同时给出了自己和 π0.5 在多项指标上的数字,构成一次有效的头对头对照。
RMBench 论文(arXiv:2603.01229)的 Table 1 里有三个数字: 面壁 MiniCPM-RobotManip 53.3、Mem-0 42.0、π0.5 10.4。 π0.5 的 10.4 与该论文交叉验证一致,这一点没有问题。
问题在于选择性对照:面壁 README 的对比表只列了 π0.5,没有列同一张表里的 Mem-0。 只看 53.3 vs 10.4,会读成五倍级的领先;把 Mem-0 放回来, 面壁相对最强公开基线的真实领先是 11.3 个百分点,而不是 42.9 个百分点。
这不是数字造假——53.3 与 10.4 都是真实的一手数字。 但挑选哪个对手进对比表,本身就是一种叙事选择。 本图谱把 Mem-0 画回雷达图上,是因为如果不画,这条轴就会成为整张图里最容易被误读的一条。 同时提醒:RMBench 全行业只有三个模型报告过,面壁是唯一主动选择这个赛场的厂商, 「在自己选的赛场上领先」与「能力更强」是两件事。
因为两者的可比轴只剩两条。灵波不报 LIBERO、不报 RMBench、不报 CALVIN、 论文与 README 也未给出总参数量(仓库名含 6b,但不能当作论文确认值); 延迟数字则因硬件不同无法并列(见下文)。 两者真正同台的只有 RoboTwin 2.0 与开放许可两项。 两条轴画不成雷达——这件事本身说明「谁更强」在当前公开信息条件下无法回答。
唯一有四家同台的基准
RoboTwin 2.0 是本次调研中唯一有四个主流模型都公开报告、且评测协议一致的基准。 这是全篇最接近「公平比较」的一张图。
LIBERO:一个已经有人考满分的基准
LIBERO 是覆盖率最高的仿真基准,也是最常被用来宣称领先的基准。 但把所有一手分数放到一起,会看到它已经失去区分能力。
延迟数字:看起来能比,其实不能
延迟是端侧路线最关键的指标,也是最容易被误用的指标。 把各家公布的数字连同测量条件一起列出,问题立刻显现。
| 模型 | 公布延迟 | 硬件 | 测量边界 |
|---|---|---|---|
| 面壁 MiniCPM-RobotManip | 120 ms | H100 / BF16 | 单帧,仅模型前向,不含自回归解码 |
| 蚂蚁 LingBot-VLA 2.0 | ~130 ms | RTX 4090D | 10 步去噪,完整部署脚本端到端 |
| 银河 GraspVLA | ~200 ms | L40s + Torch Compile | — |
| 智平方 FiS-VLA | 21.9 Hz(≈46 ms) | RTX 4090 | — |
| 面壁 MiniCPM-RobotTrack | ~180 ms | Jetson Orin NX 16GB | 端到端,机上运行 |
| GR00T N1.6 | 92 ms | Jetson Thor + TensorRT | — |
| π0.5 | 50 Hz 控制频率 | PI 官方未指定 | 官方给频率不给单步毫秒 |
两个数字只差 10 毫秒,但:面壁测的是 H100(数据中心旗舰)、 单帧输入、只算模型前向不含解码; 灵波测的是 RTX 4090D(算力低得多的消费级卡)、 含 10 步去噪、走完整部署脚本。 测量条件对面壁显著有利,因此不能据这两个数字得出面壁效率领先的结论。
第 02 章的那个发现在这里再次生效:同一个 π0 在 Thor 上 52.57 ms、 在未优化的 Orin 部署上 2966 ms,差近 60 倍。 不给测量条件的延迟数字,没有信息量。
「开源」不是一个意思
开放程度常被简化为「有没有放出权重」。但许可证决定了这些权重能不能用于商业产品, 而这项差异在公开讨论中几乎被忽略。
| 模型 | 权重 | 许可证 | 可否商用 |
|---|---|---|---|
| 面壁 MiniCPM-Robot 系列 | 公开 | Apache-2.0 | 可 |
| 蚂蚁 LingBot-VLA 1.0 / 2.0 / VA | 公开 | Apache-2.0 | 可 |
| π0 / π0-FAST / π0.5(openpi) | 公开 | Apache-2.0 | 可 |
| NVIDIA GR00T N1 – N1.7 | 公开 | Apache-2.0 | 可 |
| 智元 GO-1 / GO-1 Air | 公开 | CC BY-NC-SA 4.0 | 不可商用 |
| Figure Helix / Helix 02 | 未公开 | — | 全闭源 |
| Gemini Robotics 2 全系 | 未公开 | — | 闭源 / 白名单 |
| π0.7 / PI MEM | 未公开 | — | 未开放 |
智元把 GO-1 称为开源并公开了权重,但采用的是禁止商业使用的知识共享协议。 这与 Apache-2.0 在商业含义上完全不同。 任何把「开放程度」当作单一维度打分的比较,都会把这两件事画成一样。
还有两层失真:Demo 与「没有裁判」
Demo 与产品之间的差距是系统性的
- 特斯拉 Optimus 在 We, Robot 发布会上的交互与对话,经彭博社报道为遥操作 2024-10-14 转述
- 1X 官方披露 NEO 有 Expert Mode,由人接管复杂家务 一手
- 行业演示视频普遍 2 至 4 倍速;OpenVLA-OFT 官网注明 rollout 为 5 倍速
- Figure 至今没有公开过任何一个成功率百分比,只有视频
不存在第三方认证机构
截至 2026 年 8 月,具身智能领域没有类似 MMLU 的非厂商主导认证基准。 现有基准要么由发布模型的机构自己维护评测协议,要么已被证明失效。 目前最接近独立的两个尝试是:
RoboArena
7 所高校分布式真机评测,成对双盲对比,600+ episodes。 最接近「第三方裁判」的设计。
VLA-REPLICA
用约 1050 美元的标准硬件实现跨实验室复现, 降低了独立验证的门槛。
独立复现的结果通常不好看。BEHAVIOR-1K 挑战赛冠军的 checkpoint 被第三方复现时, 多任务 Q-score 差距超过 27 个百分点; 更严重的是85% 的 rollout 存在目标违规,但 Q-score 数值不变—— 说明这个指标本身对违规不敏感。 arXiv:2604.21192 一手
现在这套衡量能力的办法是不成立的,六个原因各自独立:
第一,没有统考,每家只公布自己考得好的那几场。 第二,最常用的那场考试已经没有区分度——星海图 G0.5 在 LIBERO 的一个子集上考了满分, 而另一批研究者只把物体位置挪一下,OpenVLA 就从 76.5% 掉到 1.1%, 说明高分靠的是记住了固定摆位,不是学会了动作。 第三,各家公布的延迟数字不能并列:测量用的硬件、精度、是否算完整流程都不一样。 第四,「开源」两个字含义差别很大:Apache-2.0 可以商用, 智元 GO-1 用的 CC BY-NC-SA 4.0 明确禁止商用。 第五,演示视频与实际产品有系统性差距,不是个别夸大。 第六,没有第三方裁判——同一个模型权重换人复现,分数就掉了 27 个百分点。
那么剩下什么是可信的?只有真机长时运行——机器人在真实场景里连续无人干预干了多久。 而这项能力取决于真机数据。
雷达图方法论:best-normalized 归一化,仅同轴内可比;「未报告」以斜纹标记且不画作 0。 完整口径声明见第 13 章。