Chapter 04 · Model Comparison

模型能力对照

这一章原本要给出一张「各家大脑能力对比雷达图」。 做完数据采集后发现做不到,而做不到的原因本身比那张图更有价值: 不存在一场所有主流模型都参加的考试。

上一章的结论 四条路线已趋同为分层式端到端,剩四条真分歧,其中「参数往大还是往小」已有明确反例。 但还有一个更根本的问题没问:我们凭什么说某条路线「更强」?这一章先试着把模型摆到一起, 再检查这些摆法本身是否成立。

先看一个事实:谁参加了哪场考试

把主流模型公开报告过的基准列出来,会看到一个非常规整的模式。

模型LIBEROCALVINRoboTwin 2.0RMBenchSimplerEnv真机基准
面壁 MiniCPM-RobotManip仅总分4.191.3 / 91.653.3未报告未报告
蚂蚁 LingBot-VLA 2.0未报告未报告93.52 / 92.80未报告未报告GM-100
星海图 G0.598.9 四分项未报告93.7 / 92.8未报告87.3BEHAVIOR-1K
智元 GO-194.8 四分项未报告未报告未报告未报告未报告
自变量 WALL-OSS-0.5仅总分 96.5未报告未报告未报告未报告17 任务
π0.596.85 四分项未报告未报告10.4(第三方测)未报告未报告
GR00T N1.697.5 四分项未报告未报告未报告62.07 / 67.66未报告
字节 Seed GR-3未报告未报告未报告未报告未报告仅真机
北京人形 XR-1未报告未报告未报告未报告未报告14,000 rollouts
Figure Helix / Helix 02未报告未报告未报告未报告未报告零百分比公开
Gemini Robotics 2未报告未报告未报告未报告未报告官方 blog 图
这张表的含义

每家都在自己占优的赛场上报数。RMBench 全行业只有 3 个模型有分数—— 面壁 53.3、Mem-0 42.0、π0.5 10.4,其中只有面壁是主动选择这个赛场的厂商; 蚂蚁灵波完全不报 LIBERO;字节与北京人形不报任何标准仿真基准; Figure 至今没有公开过任何一个成功率百分比,只有视频。

直接后果:任何跨模型雷达图的形状,主要反映的是「谁选择公开什么」,而不是「谁能力更强」。 如果把 RMBench 做成雷达的一条轴,面壁会一枝独秀——但那不是因为面壁强, 而是因为只有面壁选了这个赛场。同理,LIBERO 轴会让不报 LIBERO 的灵波显示为空白, 看起来像弱项,实际是它选择不参加。

唯一站得住的能力雷达:头对头

多模型雷达画不出来,但有一种雷达是成立的: 当同一方用同一套口径测量了两个模型时,这两个模型之间可以比。 面壁的 README 同时给出了自己和 π0.5 在多项指标上的数字,构成一次有效的头对头对照。

面壁 MiniCPM-RobotManip(1.5B) vs π0.5 · 七轴头对头 归一化口径:每轴取两者中较优值为 100,另一方按比例折算。跨轴数值不可比,面积不代表综合实力。 RMBench 论文最强基线 Mem-0 = 42.0 上下文记忆 53.3 vs 10.4 推理效率 120 vs 234 ms 参数效率 1.5B vs 3.3B LIBERO 97.5 vs 96.85 开放程度 均 Apache-2.0 跨本体构型 面壁未报告 π0 = 7 构型 真机数据规模 面壁未报告 π0 ≈ 1 万小时 面壁 MiniCPM-RobotManip π0.5 未报告(不画作 0) 面壁多边形在左侧两轴断开, 因为这两项官方未披露。 断开而不连到圆心,是为了 避免把「未披露」误读成 「能力为零」。 RMBench 论文里的最强基线 面壁的对比表没有收录它
读这张图的五个必要前提。两侧数字均由面壁一方测量,π0.5 的 234 ms 属厂商自测竞品—— 在 Physical Intelligence 与 openpi 的官方材料里找不到这个数字,PI 自己的口径是 50 Hz 控制频率,两者不等价。 ② 面壁 120 ms 的测量条件是 H100 / BF16 / 单帧 / 仅模型前向,不含自回归解码。 ③ LIBERO 轴两者几乎重合(97.5 与 96.85),这不是「势均力敌」,而是这条基准已经饱和——见下一节。 ④ 左侧两轴断开:面壁未披露跨本体构型数与真机数据规模。 这两项有公开数据的是 π0(7 构型、约 1 万小时真机),不是 π0.5—— π0.5 论文并未重复这组规模表述,引用时不能把 π0 的数据挂到 π0.5 名下。 ⑤ 上下文记忆轴上标出了第三个点:RMBench 论文自己的最强基线 Mem-0 = 42.0, 面壁的对比表只列了 π0.5 的 10.4,没有列它。 结论应读作:面壁在所有它披露的维度上都占优,但它没有披露 π0 有公开证据的那两个维度, 也没有在对比表中列出同一篇论文里更强的那个基线。 一手
上下文记忆这一轴必须打折读:真实领先幅度是 +11.3,不是 +42.9

RMBench 论文(arXiv:2603.01229)的 Table 1 里有三个数字: 面壁 MiniCPM-RobotManip 53.3Mem-0 42.0π0.5 10.4。 π0.5 的 10.4 与该论文交叉验证一致,这一点没有问题。

问题在于选择性对照:面壁 README 的对比表只列了 π0.5,没有列同一张表里的 Mem-0。 只看 53.3 vs 10.4,会读成五倍级的领先;把 Mem-0 放回来, 面壁相对最强公开基线的真实领先是 11.3 个百分点,而不是 42.9 个百分点。

这不是数字造假——53.3 与 10.4 都是真实的一手数字。 但挑选哪个对手进对比表,本身就是一种叙事选择。 本图谱把 Mem-0 画回雷达图上,是因为如果不画,这条轴就会成为整张图里最容易被误读的一条。 同时提醒:RMBench 全行业只有三个模型报告过,面壁是唯一主动选择这个赛场的厂商, 「在自己选的赛场上领先」与「能力更强」是两件事

为什么不能对面壁与蚂蚁灵波画同样的雷达

因为两者的可比轴只剩两条。灵波不报 LIBERO、不报 RMBench、不报 CALVIN、 论文与 README 也未给出总参数量(仓库名含 6b,但不能当作论文确认值); 延迟数字则因硬件不同无法并列(见下文)。 两者真正同台的只有 RoboTwin 2.0 与开放许可两项。 两条轴画不成雷达——这件事本身说明「谁更强」在当前公开信息条件下无法回答。

唯一有四家同台的基准

RoboTwin 2.0 是本次调研中唯一有四个主流模型都公开报告、且评测协议一致的基准。 这是全篇最接近「公平比较」的一张图。

RoboTwin 2.0 · 50 项双臂任务平均成功率 深色 = Clean(干净场景) 浅色 = Randomized / Hard(强域随机化) 85% 95% 星海图 G0.5 93.7 92.8 蚂蚁 LingBot-VLA 2.0 93.52 92.80 蚂蚁 LingBot-VA 1.0 92.93 91.55 面壁 MiniCPM-RobotManip 91.3 91.6 来源:G0.5 arXiv:2608.11739 · LingBot-VLA 2.0 GitHub · LingBot-VA arXiv:2601.21998 Table 1 · MiniCPM-Robot GitHub 一手
四家差距在 2.4 个百分点以内。 更值得注意的是第二个现象:Hard 模式(强域随机化)与 Clean 模式几乎没有差距, 面壁甚至 Hard 略高于 Clean。这说明 RoboTwin 2.0 的域随机化也已接近饱和—— 它已经不能有效区分模型的泛化能力。 注:LingBot-VA 论文摘要写 92.0、Table 1 写 92.93,此处采用 Table 1。

LIBERO:一个已经有人考满分的基准

LIBERO 是覆盖率最高的仿真基准,也是最常被用来宣称领先的基准。 但把所有一手分数放到一起,会看到它已经失去区分能力。

LIBERO 平均成功率 · 所有有一手数据的模型 横轴为成功率。七个模型全部挤在右端不到 4.1 个百分点的区间内。 94–100 拥挤区 70 80 90 94 100 OpenVLA 76.5 星海图 G0.5 98.9 蚂蚁 LingBot-VA 98.5 GR00T N1.6 ≈97.5 面壁 MiniCPM 97.5 π0.5 96.85 自变量 WALL-OSS 96.5 智元 GO-1 94.8 星海图 G0.5 在 Object 子集上已达 100.0%——单个子集被打满。 而 LIBERO-Plus 显示:只把物体位置挪一下,OpenVLA 从 76.5% 掉到 1.1%。
七个模型挤在 94.8–98.9 之间,跨度不到 4.1 个百分点。 星海图 G0.5 的 Object 子集已达 100.0%,蚂蚁 LingBot-VA 的 Object 达 99.6%。 与此同时,LIBERO-PRO 论文的结论是:90 分以上的成绩很大程度上是背题的产物而非能力体现。 一场已经有人考满分、而且被证明是靠背题拿分的考试,不能再用来衡量谁更强。 这就是本图谱把 LIBERO 从雷达轴上移除、只保留在对照表中的原因。 来源:arXiv:2510.03827(LIBERO-PRO)、arXiv:2510.13626(LIBERO-Plus)一手

延迟数字:看起来能比,其实不能

延迟是端侧路线最关键的指标,也是最容易被误用的指标。 把各家公布的数字连同测量条件一起列出,问题立刻显现。

模型公布延迟硬件测量边界
面壁 MiniCPM-RobotManip120 msH100 / BF16单帧,仅模型前向,不含自回归解码
蚂蚁 LingBot-VLA 2.0~130 msRTX 4090D10 步去噪,完整部署脚本端到端
银河 GraspVLA~200 msL40s + Torch Compile
智平方 FiS-VLA21.9 Hz(≈46 ms)RTX 4090
面壁 MiniCPM-RobotTrack~180 msJetson Orin NX 16GB端到端,机上运行
GR00T N1.692 msJetson Thor + TensorRT
π0.550 Hz 控制频率PI 官方未指定官方给频率不给单步毫秒
面壁 120 ms 与灵波 130 ms 不能相比

两个数字只差 10 毫秒,但:面壁测的是 H100(数据中心旗舰)、 单帧输入只算模型前向不含解码; 灵波测的是 RTX 4090D(算力低得多的消费级卡)、 含 10 步去噪、走完整部署脚本。 测量条件对面壁显著有利,因此不能据这两个数字得出面壁效率领先的结论。

第 02 章的那个发现在这里再次生效:同一个 π0 在 Thor 上 52.57 ms、 在未优化的 Orin 部署上 2966 ms,差近 60 倍。 不给测量条件的延迟数字,没有信息量。

「开源」不是一个意思

开放程度常被简化为「有没有放出权重」。但许可证决定了这些权重能不能用于商业产品, 而这项差异在公开讨论中几乎被忽略。

模型权重许可证可否商用
面壁 MiniCPM-Robot 系列公开Apache-2.0
蚂蚁 LingBot-VLA 1.0 / 2.0 / VA公开Apache-2.0
π0 / π0-FAST / π0.5(openpi)公开Apache-2.0
NVIDIA GR00T N1 – N1.7公开Apache-2.0
智元 GO-1 / GO-1 Air公开CC BY-NC-SA 4.0不可商用
Figure Helix / Helix 02未公开全闭源
Gemini Robotics 2 全系未公开闭源 / 白名单
π0.7 / PI MEM未公开未开放

智元把 GO-1 称为开源并公开了权重,但采用的是禁止商业使用的知识共享协议。 这与 Apache-2.0 在商业含义上完全不同。 任何把「开放程度」当作单一维度打分的比较,都会把这两件事画成一样。

还有两层失真:Demo 与「没有裁判」

Demo 与产品之间的差距是系统性的

不存在第三方认证机构

截至 2026 年 8 月,具身智能领域没有类似 MMLU 的非厂商主导认证基准。 现有基准要么由发布模型的机构自己维护评测协议,要么已被证明失效。 目前最接近独立的两个尝试是:

RoboArena

7 所高校分布式真机评测,成对双盲对比,600+ episodes。 最接近「第三方裁判」的设计。

VLA-REPLICA

用约 1050 美元的标准硬件实现跨实验室复现, 降低了独立验证的门槛。

独立复现的结果通常不好看。BEHAVIOR-1K 挑战赛冠军的 checkpoint 被第三方复现时, 多任务 Q-score 差距超过 27 个百分点; 更严重的是85% 的 rollout 存在目标违规,但 Q-score 数值不变—— 说明这个指标本身对违规不敏感。 arXiv:2604.21192 一手

这一章要交出的结论

现在这套衡量能力的办法是不成立的,六个原因各自独立:

第一,没有统考,每家只公布自己考得好的那几场。 第二,最常用的那场考试已经没有区分度——星海图 G0.5 在 LIBERO 的一个子集上考了满分, 而另一批研究者只把物体位置挪一下,OpenVLA 就从 76.5% 掉到 1.1%, 说明高分靠的是记住了固定摆位,不是学会了动作。 第三,各家公布的延迟数字不能并列:测量用的硬件、精度、是否算完整流程都不一样。 第四,「开源」两个字含义差别很大:Apache-2.0 可以商用, 智元 GO-1 用的 CC BY-NC-SA 4.0 明确禁止商用。 第五,演示视频与实际产品有系统性差距,不是个别夸大。 第六,没有第三方裁判——同一个模型权重换人复现,分数就掉了 27 个百分点。

那么剩下什么是可信的?只有真机长时运行——机器人在真实场景里连续无人干预干了多久。 而这项能力取决于真机数据。

因此下一章要回答 第 05 章:既然只有真机数据说话算数,那采这些数据到底有多贵? 行业提出的三条省事办法——在仿真里练、看人类视频、用世界模型生成数据—— 各自真能省下多少?答案会推出这份图谱最重要的一个判断: 真机数据是这个产业里唯一花钱买不到、也没法用算法补齐的东西。
04 / 13
本章数字来源:MiniCPM-Robot GitHub / HF、arXiv:2603.01229(RMBench)、 arXiv:2608.11739(G0.5)、arXiv:2601.21998 与 2607.06403(蚂蚁灵波)、 AgiBot-World LIBERO README、arXiv:2605.30877(WALL-OSS)、openpi GitHub、 NVIDIA Isaac-GR00T、arXiv:2510.03827、arXiv:2510.13626、arXiv:2604.21192、 arXiv:2505.03233、Fast-in-Slow (NeurIPS 2025)。
雷达图方法论:best-normalized 归一化,仅同轴内可比;「未报告」以斜纹标记且不画作 0。 完整口径声明见第 13 章。