物理世界三道约束
机器人的大脑必须同时做到三件事: 换到没见过的房间还能干活、每一步动作在几十毫秒内想清楚、 记住几分钟前发生过什么。行业分别把这三件事叫做泛化、实时和长程记忆。
单独看,每一件都不算特别难。难的是它们互相抢资源。 模型参数做大,换房间的能力会变好,但算一步的时间也跟着变长; 把速度压下来,能塞进模型的历史画面就变少,几分钟前的事就记不住了。 所以各条技术路线之间的分歧,说到底是在这三件事里选择先放弃哪一件。 这一章把三件事各自的硬边界用一手数据量出来。
约束一 · 泛化:换个场景就掉一半
泛化指模型在没见过的环境里还能不能干活。 业内常用两个词区分:ID(域内) 指训练时见过的场景,OOD(域外) 指没见过的。差距有多大,各家自己公布的数字最有说服力。
LIBERO-Plus 论文给 LIBERO 加了七类扰动,其中一类只是把物体位置挪动一下, 任务和指令都不改。OpenVLA 在原版 LIBERO 上是 76.5%,在这七类扰动的总分上掉到 17.3%; 而单看「物体位置挪动」这一项,只剩 1.1%。 这说明高分不是学会了操作,而是背下了题目。 同一实验里改进版 OpenVLA-OFT 表现好得多(原版 97.1%、总分 70.0%、物体位置一项 59.7%), 说明这不是无解,但差距的量级说明现有分数远不能当成能力证明。 第 04 章会用这个发现来质疑整个基准体系。 arXiv:2510.13626 表 1–2 一手
约束二 · 实时:预算只有几十毫秒
机器人的控制环有固定节拍。操作任务常见 30 Hz,即每秒下发 30 次指令, 每次留给模型思考的时间只有约 33 毫秒。 全身运动控制要求更高:宇树 G1 的中层控制跑 500 Hz, 傅利叶 GR1 的力矩控制跑 1000 Hz——留给单步的时间是 1 毫秒。
学界对「够快」的定义已有共识口径: 10 Hz 算可接受(接近相机帧率),100 Hz 算高性能。 VLA-Perf, arXiv:2602.18397 一手
端侧算力预算:两张芯片的账
| 指标 | Jetson AGX Orin 64GB | Jetson Thor T5000 |
|---|---|---|
| 标称算力 | 275 TOPS(INT8 Sparse) | 2070 TFLOPS(FP4 Sparse) |
| 内存 | 64 GB | 128 GB LPDDR5X |
| 内存带宽 | 204.8 GB/s | 273 GB/s |
| 功耗 | 15–60 W | 40–130 W |
| 开发套件价格 | — | $3,499 → $5,499 |
Orin 标的是 TOPS(INT8 整数运算),Thor 标的是 TFLOPS(FP4 浮点运算)—— 精度口径完全不同。看起来 2070 比 275 高七倍多,但这是两种度量单位。 更关键的是:VLA 模型的瓶颈常在内存带宽而非峰值算力, 而两者带宽只差 33%(273 vs 204.8 GB/s)。 这解释了为什么 3B 模型在 Thor 上也只能跑到约 11 Hz。
实测延迟:同一个模型能差两个数量级
| 模型 | 延迟 / 频率 | 硬件与条件 | 来源 |
|---|---|---|---|
| π0(VLA-Perf 记为 2.7B) | 52.57 ms / 19.0 Hz | Jetson Thor,roofline 推算 | VLA-Perf 一手 |
| π0(同一模型) | 2,966 ms | Jetson Orin,未优化 PyTorch 部署 | SwiftVLA, CVPR 2026 一手 |
| GR00T N1.6(3B) | 92 ms / 10.9 Hz | Jetson Thor + TensorRT | NVIDIA 官方文档 一手 |
| GR00T N1.6(3B) | 173 ms / 5.8 Hz | Jetson AGX Orin | NVIDIA 官方文档 一手 |
| OpenVLA(7B) | 840 ms | Orin,FP16 | Jetson AI Lab 一手 |
| OpenVLA(7B) | 336 ms | Orin,INT4 量化后 | Jetson AI Lab 一手 |
| π0-XL(16.7B,假设模型) | 2.1 Hz | Jetson Thor,roofline 推算 | VLA-Perf 一手 |
同一个 π0 模型,在两篇一手论文里的实测差距是 52 毫秒对 2966 毫秒,接近 60 倍。
差异来自硬件型号与是否做过推理优化(TensorRT、CUDA Graph、算子融合、量化)。
推论:一个模型「能不能在端侧跑」,很大程度上取决于有没有人认真做过部署优化,而不只取决于参数量。
这也意味着任何厂商公布的延迟数字,不看测量条件就没有意义。第 04 章会用这条标准去检查各家的延迟宣称。
约束三 · 长程记忆:几分钟前的事记不住
很多真实任务需要记忆。「把刚才收进抽屉的那个杯子拿出来」—— 如果模型只看当前画面,它不知道杯子在哪。 2026 年 3 月发布的 RMBench 专门测这件事: 基于 RoboTwin 2.0 构建 9 个依赖记忆的双臂任务。结果分化极大。
记忆的代价是算力。面壁的做法是保留 60 帧视觉历史(约 1 分钟,按 1 帧/秒), 并用流式推理把每步计算量 从 125 TFLOPs 压到 3.3 TFLOPs。 MiniCPM-Robot README 一手 这个压缩比说明:不做特殊优化的话,长历史的算力开销会直接吃掉实时性预算。
三道约束为什么不能同时满足
直觉上的解法是「把模型做大」——参数多了泛化自然好。 但有两条一手证据挡在前面。
参数放大的收益很低
一项汇总 34 项研究的统计给出模型尺寸的 scaling 指数 落在 −0.172 到 −0.246 之间。 按偏悲观的 −0.172 算,性能翻一倍需要参数量增加约 56 倍; 按 −0.246 算约 17 倍。两个数都远高于「翻倍参数换翻倍性能」的直觉。
arXiv:2405.14005 一手
放大后直接撞上实时约束
VLA-Perf 的作者按 π0 的架构原则拼了一组更大的假设模型做推算。 其中 16.7B 那一档(论文记为 π0-XL)在最强的端侧芯片 Jetson Thor 上只有 2.1 Hz,在 RTX 4090 上直接显存不够。 远低于「10 Hz 可接受」的门槛,等于无法用于实时操作。
VLA-Perf, arXiv:2602.18397 表 5 一手 π0-XL 并非 Physical Intelligence 发布的模型
三件事各自的硬边界,都能用一手数据量出来: 换到没见过的场景,成功率普遍要掉 19 到 47 个百分点; 一步决策留给模型的时间只有几十毫秒, 而同一个模型换不同的部署方式,实测速度能差 60 倍,所以各家报的延迟根本不能并列看; 要让机器人记住几分钟前的事,必须专门做算力优化, 否则这部分开销会把实时性吃掉。
更关键的是,把模型做大解决不了这个矛盾。
一项覆盖 34 项研究的统计显示,性能要翻一倍,参数量得增加 17 到 56 倍;
而按 VLA-Perf 的推算,模型放大到 167 亿参数这一档,
在目前最强的机器人芯片上只能跑到每秒 2.1 次决策,远低于可用下限。
所以每一条技术路线,都是在这个三角里挑一个落点。
不同任务与评测协议的绝对值不可横向比较,已在各图注中标明。