Chapter 02 · Three Constraints

物理世界三道约束

机器人的大脑必须同时做到三件事: 换到没见过的房间还能干活每一步动作在几十毫秒内想清楚记住几分钟前发生过什么。行业分别把这三件事叫做泛化、实时和长程记忆。

单独看,每一件都不算特别难。难的是它们互相抢资源。 模型参数做大,换房间的能力会变好,但算一步的时间也跟着变长; 把速度压下来,能塞进模型的历史画面就变少,几分钟前的事就记不住了。 所以各条技术路线之间的分歧,说到底是在这三件事里选择先放弃哪一件。 这一章把三件事各自的硬边界用一手数据量出来。

上一章的结论 焦点转向大脑,是因为身体已能量产盈利,但客户只为「会动」付钱、还没为「会干活」付钱; 连宇树创始人都把模型称为「最大阻碍」。而大脑难做的根本原因,是它必须对物理世界负责。 这一章拆解这个「负责」具体有多硬。

约束一 · 泛化:换个场景就掉一半

泛化指模型在没见过的环境里还能不能干活。 业内常用两个词区分:ID(域内) 指训练时见过的场景,OOD(域外) 指没见过的。差距有多大,各家自己公布的数字最有说服力。

同一模型 · 域内 vs 域外成功率(各家自报或论文数据) 域内 ■ 域外 ■  (横条长度按成功率比例) 灵波 · 冰箱分拣 Astribot S1 60.0% 13.3% −46.7 个百分点 灵波 · 灶台清洁 Cobot Magic 66.7% 40.0% −26.7 个百分点 π0.5 · 真机任务 VLA-REPLICA 复现 54% 35% −19 个百分点 OpenVLA-OFT LIBERO → LIBERO-Plus 97%+ 70.0% −27 个百分点(七维扰动)
泛化衰减是普遍现象,不是个别模型的缺陷。 最剧烈的一例是蚂蚁灵波自己公布的:冰箱分拣任务从 60.0% 掉到 13.3%。 注意这些数字来自不同任务与不同评测协议,不可横向比较绝对值, 只可各自比较「同一模型域内与域外的落差」。 来源:LingBot-VLA 2.0 GitHub、arXiv:2605.20774、arXiv:2510.13626 一手
最值得记住的一个数字

LIBERO-Plus 论文给 LIBERO 加了七类扰动,其中一类只是把物体位置挪动一下, 任务和指令都不改。OpenVLA 在原版 LIBERO 上是 76.5%,在这七类扰动的总分上掉到 17.3%; 而单看「物体位置挪动」这一项,只剩 1.1%。 这说明高分不是学会了操作,而是背下了题目。 同一实验里改进版 OpenVLA-OFT 表现好得多(原版 97.1%、总分 70.0%、物体位置一项 59.7%), 说明这不是无解,但差距的量级说明现有分数远不能当成能力证明。 第 04 章会用这个发现来质疑整个基准体系。 arXiv:2510.13626 表 1–2 一手

约束二 · 实时:预算只有几十毫秒

机器人的控制环有固定节拍。操作任务常见 30 Hz,即每秒下发 30 次指令, 每次留给模型思考的时间只有约 33 毫秒。 全身运动控制要求更高:宇树 G1 的中层控制跑 500 Hz, 傅利叶 GR1 的力矩控制跑 1000 Hz——留给单步的时间是 1 毫秒。

学界对「够快」的定义已有共识口径: 10 Hz 算可接受(接近相机帧率),100 Hz 算高性能VLA-Perf, arXiv:2602.18397 一手

端侧算力预算:两张芯片的账

指标Jetson AGX Orin 64GBJetson Thor T5000
标称算力275 TOPS(INT8 Sparse)2070 TFLOPS(FP4 Sparse)
内存64 GB128 GB LPDDR5X
内存带宽204.8 GB/s273 GB/s
功耗15–60 W40–130 W
开发套件价格$3,499 → $5,499
这两个算力数字不能直接相除

Orin 标的是 TOPS(INT8 整数运算),Thor 标的是 TFLOPS(FP4 浮点运算)—— 精度口径完全不同。看起来 2070 比 275 高七倍多,但这是两种度量单位。 更关键的是:VLA 模型的瓶颈常在内存带宽而非峰值算力, 而两者带宽只差 33%(273 vs 204.8 GB/s)。 这解释了为什么 3B 模型在 Thor 上也只能跑到约 11 Hz。

实测延迟:同一个模型能差两个数量级

模型延迟 / 频率硬件与条件来源
π0(VLA-Perf 记为 2.7B)52.57 ms / 19.0 HzJetson Thor,roofline 推算VLA-Perf 一手
π0(同一模型)2,966 msJetson Orin,未优化 PyTorch 部署SwiftVLA, CVPR 2026 一手
GR00T N1.6(3B)92 ms / 10.9 HzJetson Thor + TensorRTNVIDIA 官方文档 一手
GR00T N1.6(3B)173 ms / 5.8 HzJetson AGX OrinNVIDIA 官方文档 一手
OpenVLA(7B)840 msOrin,FP16Jetson AI Lab 一手
OpenVLA(7B)336 msOrin,INT4 量化后Jetson AI Lab 一手
π0-XL(16.7B,假设模型2.1 HzJetson Thor,roofline 推算VLA-Perf 一手
这张表最重要的一行不是最快的那行

同一个 π0 模型,在两篇一手论文里的实测差距是 52 毫秒对 2966 毫秒,接近 60 倍。 差异来自硬件型号与是否做过推理优化(TensorRT、CUDA Graph、算子融合、量化)。
推论:一个模型「能不能在端侧跑」,很大程度上取决于有没有人认真做过部署优化,而不只取决于参数量。 这也意味着任何厂商公布的延迟数字,不看测量条件就没有意义。第 04 章会用这条标准去检查各家的延迟宣称。

约束三 · 长程记忆:几分钟前的事记不住

很多真实任务需要记忆。「把刚才收进抽屉的那个杯子拿出来」—— 如果模型只看当前画面,它不知道杯子在哪。 2026 年 3 月发布的 RMBench 专门测这件事: 基于 RoboTwin 2.0 构建 9 个依赖记忆的双臂任务。结果分化极大。

RMBench · 记忆依赖任务总分(满分 100) 全行业只有 3 个模型报告过这个基准——这本身是重要信息 面壁 MiniCPM-RobotManip 53.3 Mem-0 42.0 ← 面壁对比表未收录此项 π0.5 10.4 来源:RMBench 论文 arXiv:2603.01229 Table 1(π0.5 与 Mem-0);面壁 MiniCPM-Robot GitHub README
诚实性说明。面壁的对比表列出了 π0.5 的 10.4 分,但未列出同一篇 RMBench 论文中 Mem-0 的 42.0 分。 按最强公开基线计算,面壁的领先幅度是约 11.3 个百分点,而不是对比表暗示的 42.9 个百分点。 π0.5 = 10.4 这个数字在 RMBench 论文原文中得到交叉验证,可信。 一手 · 交叉验证

记忆的代价是算力。面壁的做法是保留 60 帧视觉历史(约 1 分钟,按 1 帧/秒), 并用流式推理把每步计算量 从 125 TFLOPs 压到 3.3 TFLOPs。 MiniCPM-Robot README 一手 这个压缩比说明:不做特殊优化的话,长历史的算力开销会直接吃掉实时性预算。

三道约束为什么不能同时满足

直觉上的解法是「把模型做大」——参数多了泛化自然好。 但有两条一手证据挡在前面。

参数放大的收益很低

一项汇总 34 项研究的统计给出模型尺寸的 scaling 指数 落在 −0.172 到 −0.246 之间。 按偏悲观的 −0.172 算,性能翻一倍需要参数量增加约 56 倍; 按 −0.246 算约 17 倍。两个数都远高于「翻倍参数换翻倍性能」的直觉。

arXiv:2405.14005 一手

放大后直接撞上实时约束

VLA-Perf 的作者按 π0 的架构原则拼了一组更大的假设模型做推算。 其中 16.7B 那一档(论文记为 π0-XL)在最强的端侧芯片 Jetson Thor 上只有 2.1 Hz,在 RTX 4090 上直接显存不够。 远低于「10 Hz 可接受」的门槛,等于无法用于实时操作。

VLA-Perf, arXiv:2602.18397 表 5 一手  π0-XL 并非 Physical Intelligence 发布的模型

三道约束构成一个不可能三角 泛化 换个场景还能干活 实时 每步几十毫秒内出结果 记忆 记住几分钟前的事 模型做大 → 泛化改善但延迟恶化 (scaling 指数仅 −0.246) 保留长历史 → 记忆改善但算力被吃掉 (125 → 3.3 TFLOPs 需专门优化) 压低延迟 → 牺牲模型容量与历史长度 当前主流方案落点: 按时间尺度分层,让不同频率的 子模块各自负责一个角
不可能三角,以及行业实际的解法。 主流做法不是在三者间选一个,而是把模型内部按时间尺度拆开: 让一个慢速大模块负责泛化与记忆(7–10 Hz), 一个快速小模块负责实时动作(120–200 Hz)。 这就是第 03 章要讲的「分层式端到端」——它不是理论上的最优解,而是被三道约束逼出来的工程妥协。
这一章要交出的结论

三件事各自的硬边界,都能用一手数据量出来: 换到没见过的场景,成功率普遍要掉 19 到 47 个百分点一步决策留给模型的时间只有几十毫秒, 而同一个模型换不同的部署方式,实测速度能差 60 倍,所以各家报的延迟根本不能并列看; 要让机器人记住几分钟前的事,必须专门做算力优化, 否则这部分开销会把实时性吃掉。

更关键的是,把模型做大解决不了这个矛盾。 一项覆盖 34 项研究的统计显示,性能要翻一倍,参数量得增加 17 到 56 倍; 而按 VLA-Perf 的推算,模型放大到 167 亿参数这一档, 在目前最强的机器人芯片上只能跑到每秒 2.1 次决策,远低于可用下限。
所以每一条技术路线,都是在这个三角里挑一个落点。

因此下一章要回答 第 03 章:四条技术路线各自站在三角的哪个位置,用什么换了什么? 还有一个可能和你印象相反的结论——到 2026 年, 这四条路线的差别比公开讨论里听起来的小得多,真正还没有定论的只剩四个问题。
02 / 13
本章数字来源:LingBot-VLA 2.0 GitHub、arXiv:2605.20774(VLA-REPLICA)、 arXiv:2510.13626(LIBERO-Plus)、arXiv:2602.18397(VLA-Perf)、 SwiftVLA (CVPR 2026)、arXiv:2603.01229(RMBench)、arXiv:2405.14005、 NVIDIA Jetson 官方规格与 Isaac GR00T 优化文档。
不同任务与评测协议的绝对值不可横向比较,已在各图注中标明。