四条路线四种妥协
行业里常说有两派在争:一派主张把活拆开做—— 大模型只负责想「先拿海绵、再擦桌子」,具体怎么动手交给另一套专门的程序; 另一派主张一个网络从头包到尾,看到画面直接输出关节该转多少度。 前者叫分层派,后者叫端到端派。
到 2026 年,这场争论其实已经结束了。 四条主流路线最后收敛成了同一种做法:一个模型内部分成快慢两层, 慢的那层几秒钟想一次「下一步干什么」,快的那层每秒上百次输出具体动作。 分歧不再是「要不要分层」,而是分层要分在模型内部还是外部。 这一章先看四条路线各自牺牲了什么,再列出真正还没有定论的四个分歧—— 每一个都有实验证据支撑双方,不是立场之争。
路线 A · 分层解耦:让大模型当指挥,不当乐手
最早的思路:用大模型做高层规划,底层动作交给传统控制或预先训练好的 技能库。 大模型只需要输出「先拿海绵,再擦桌子」这样的步骤序列。
SayCan / PaLM-SayCan
LLM 提出候选技能,技能自身的价值函数判断当前可行性,两者相乘选出下一步。 PaLM 版本正确技能序列 84%,实际执行成功 74%。
VoxPoser
LLM 写代码调用 VLM,生成三维空间的价值地图,再交给传统运动规划器合成轨迹。 不需要任何机器人训练数据即可零样本执行。
Being-0
云端基础模型 + Connector VLM + 模块化技能库。论文明确指出: 直接拼接基础模型与技能库会因复合错误和模块间延迟不一致导致鲁棒性差。
能力上界等于技能库的并集。 遇到技能库里没有的动作,无论大模型多聪明都做不了——必须重新采集演示数据、训练新技能。 这等于把「泛化」这个角完全让给了人工工程。
路线 B · 端到端 VLA:一个网络从画面直接到动作
反方向的思路:不要中间层,让一个网络吃进图像和指令、直接吐出动作。 关键技巧是把连续的关节角度离散化成类似「单词」的符号 (action token), 这样就能复用语言模型的全套训练方法。
| 模型 | 参数量 | 关键做法与结果 |
|---|---|---|
| RT-2 / RT-2-X | 55B / 5B | 动作表示为文本 token,与 VLM 联合微调。RT-2-X 在新技能上达 75.8%(RT-2 为 27.3%) |
| OpenVLA | 7B | 在 29 个任务上比 550 亿参数的 RT-2-X 高 16.5 个百分点——首次证明小模型可以赢大模型 |
| Octo | 93M / 27M | Transformer + diffusion 动作头,80 万条 OXE 轨迹训练 |
| π0 | 3.3B | PaliGemma 3B + flow matching 动作专家 300M,最高 50 Hz |
四个已被实验证实的死穴
动作分块的开环盲区
为了提速,模型一次预测未来一整段动作 (action chunking)。 但执行这段动作期间不再看新画面——物体滑落或发生碰撞无法实时响应。
arXiv:2607.01804 一手
模仿学习的复合错误
轻微偏离演示轨迹就进入训练未覆盖的状态,偏离进一步放大。 实验中模型在视觉扰动下反复掉落物体。
arXiv:2505.19789 一手
自回归解码太慢
OpenVLA 单步动作在 A100 上需 0.33 秒。 因为要为 chunk 长度 × 动作维度次串行解码。
arXiv:2502.19645 一手
跨本体数据会互相干扰
只用 OXE 数据训练成功率 77.3%, 加入更多末端执行器数据后反而降到 72.1%。
arXiv:2602.09722 一手
「数据越多越好」在跨本体场景下不成立。 把不同构型的机器人数据混在一起训练,可能出现负迁移—— 就像把游泳教练的训练手册直接给滑雪选手,动作库越杂越互相干扰。 这条证据在第 05 章讨论数据墙时会再次出现:缺的不只是数据量,更是数据的密度与配比。
路线 C · 端到端内部再分层:2026 年的事实主流
把 A 和 B 的教训合起来:对外是单一训练与部署管线(学 B), 对内按时间尺度分成慢快子模块(学 A),但两者联合优化而非分别开发。 这就是 2026 年绝大多数领先模型的实际形态。
智元的 ViLLA 架构是同一配方的国内版本: InternVL2.5-2B 视觉语言模型 + 混合专家结构(24 层隐式规划器 + 扩散动作专家)。 arXiv:2503.06669 一手。 注:媒体常写 InternVL-2B,论文原文为 InternVL2.5-2B
慢层与快层可能脱节。慢层产出的中间指令,快层未必执行得了; 慢层本身有延迟,等它算完时给出的引导可能已经过时。 OneTwoVLA, arXiv:2505.11917 一手
另一个细节很能说明工程权衡:π0.5 在预训练阶段用离散 token(便于大规模训练), 但在后训练阶段切回 flow matching。原因写在 FAST 论文里—— 离散表示「不太适合实时推理」。同一个团队在两个阶段选了两种动作表示。
路线 D · 世界模型:本质是绕开数据墙的尝试
前三条路线都在解决「怎么把数据变成动作」。第四条路线换了问题: 能不能让模型先学会「世界会怎么变」,从而少用真机数据? 2026 年 5 月的综述给这类模型起了正式名字: WAM(World Action Model)。
| 代表工作 | 做法 | 关键数字 |
|---|---|---|
| 蚂蚁 LingBot-World | 28B 混合专家扩散模型做世界模拟器 | 16 FPS / 480p 实时交互 16 FPS 是蒸馏出的 Fast 变体指标,28B 基础版本本身不跑这个速度,两个数字不属于同一配置 |
| 蚂蚁 LingBot-VA | 视频与动作联合自回归,5.3B(视频流 5B + 动作流 350M) | RoboTwin Easy 92.93%,RSS 2026 |
| 蚂蚁 LingBot-VA 2.0 | 稀疏 MoE(128 专家选 8)+ 前瞻推理异步化 | 峰值 225 Hz 异步控制 |
| 自变量 WALL-WM | 把预测单位从固定帧数改为语义事件 | 真机 75.86 vs π0.5 55.64 |
| Google Genie 3 | 可交互世界生成 | 720p / 24 fps / 约 1 分钟记忆 |
| NVIDIA Cosmos 3 | 生成器 + 推理器,附 WAM 策略权重 | 官方定位:预训练想象,微调行动 |
但每一项声称都被打了折
支持方证据
- Dreamer 4 已能纯离线在想象中学习(游戏域)
- LingBot-VA 在 RoboTwin 与 LIBERO 上确有一手高分
- NVIDIA、Google、蚂蚁、自变量同时下注
- WALL-WM 的事件级预测有真机对比数据
反对方证据
- Genie 3 官方承认:无法精确模拟真实地理,交互仅数分钟,且没有任何机器人操作基准
- 1X 声称世界模型可免去机器人预训练,但 TechCrunch 实测仅完成取空气炸锅篮、放吐司、击掌
- LingBot-World 官方自承:长时漂移、需企业级 GPU、精细操控有限
- 自变量 WALL-B 声称「失败后在线更新参数自我进化」,但只有媒体报道,无论文与基准
把一手证据放在一起,结论比较清楚: 世界模型目前是真机数据的放大器,不是替代品。 在游戏域走得最远(Dreamer 4 纯离线),在自动驾驶有下游验证, 在物理机器人的精细操作上仍最保守——连 NVIDIA 自己的口号都是「预训练想象、微调行动」, 而不是「用想象替代真机」。第 05 章会用完整的一手证据链展开这一点。
趋同之后,真正剩下的四条分歧
需要强调:以下四条不是立场差异,每一条都有实验证据支撑双方。
| 分歧 | 一方 | 另一方 | 证据状态 |
|---|---|---|---|
| 动作表示 | 离散 token RT-2 / OpenVLA / π0-FAST |
连续 flow / diffusion π0 / GR00T / Octo / GO-1 |
π0.5 两阶段各用一种,说明各有适用场景 |
| 是否需要显式中间表示 | 隐式端到端 | 显式子任务 / latent 规划器 / ER 层 | OneTwoVLA 批评硬解耦,Fast-in-Slow 主张共享骨干,未决 |
| 预训练起点 | 嫁接现成 VLM(主流) | 从零联合训练 自变量 WALL-B 声称 |
从零派尚无公开论文与基准 |
| 参数规模方向 | 往大做 | 往小做 | 已有反例:S2-VLA 2B 在长时任务上超过 7B 模型 |
最后一条对本图谱后续很重要。行业默认「更大更强」, 但 arXiv:2606.27872 报告了 20 亿参数模型在长时任务上超过 70 亿参数模型的结果, 结合第 02 章的 scaling 指数(−0.246)与端侧延迟约束, 「小模型 + 端侧部署」构成一条在技术上站得住的独立路线—— 面壁 1.5B 的 MiniCPM-RobotManip 与星海图 250M 的 G0Tiny 都在这条线上。
四条路线最后收敛成了同一种做法,可以叫「表面一体、内部分层」: 对外是一个模型,从画面直接出动作,中间不需要人写规则; 对内则按快慢分成两层甚至三层—— 慢的那层每秒想 7 到 10 次「下一步干什么」, 快的那层每秒输出 120 到 200 次具体动作, Figure 的 Helix 02 还在最底下加了一层每秒 1000 次的力控。 慢层几乎都是直接拿现成的视觉语言大模型改的,这样能省下大量常识训练。
还没有定论的四个问题,正反双方都有实验数据。
其中「模型该做大还是做小」已经出现明确反例:
有 20 亿参数的模型在长任务上打赢了 70 亿参数的。
但这里有一个更根本的问题一直没问:我们凭什么说某条路线「更强」?