OneVLA:统一导航与操作的视觉语言行动模型
Zhang, L. et al. OneVLA: A Unified Framework for Embodied Tasks. arXiv:2606.01241v2, 2026. 论文|代码
三个问题
1. 论文解决了什么问题?
现有视觉语言行动(VLA)模型大多专精于导航或机械臂操作;即使少数跨任务方法能同时覆盖两类任务,仍常要为不同任务配备独立动作头或专门微调的模型变体。OneVLA 要回答的是:能否用一个不切换结构的模型,同时输出导航和操作动作,并让两种任务在训练中彼此促进。
2. 作者提出了什么方法?
OneVLA 以 Qwen2.5-VL-3B 为视觉语言骨干,使用一个统一的、基于流匹配(flow matching)的动作头,将 4 维离散导航动作与 7 维连续末端执行器控制拼为 11 维输出;训练时再用任务相关的维度掩码只监督当前任务。训练按“操作 + 通用视觉语言数据 → 加入导航联合训练 → 加入思维链(CoT)数据”的三阶段渐进式策略进行。
3. 对我有什么启发?
跨具身任务的统一不一定要求强行定义完全相同的动作语义;可以先把异构动作对齐到一个固定的超集输出空间,再以掩码监督和任务指令选择有效子空间。比起一次性混合所有数据,先建立一种技能、再逐步引入另一技能和显式推理监督,可能更利于稳定的正迁移。
一句话总结
OneVLA 是一个用单一模型同时做连续视觉语言导航与 7-DoF 机械臂操作的 VLA。论文报告其在 VLN-CE R2R/RxR 上的 OSR 为 68.6%/58.2%,在 SimplerEnv 四项操作任务上的平均成功率为 64.5%,并将这归因于统一动作头、导航-操作联合训练与 CoT 微调(第 8–9 页,表 1–3)。
研究问题与动机
导航与操作分别需要不同的动作形式:前者通常是前进、左转、右转、停止等离散控制,后者是连续的末端位姿和夹爪控制。此前的单任务 VLA 因此各自建模;跨任务模型(如论文所比较的 UniVLA)也采用任务专用动作头或对应的微调版本。作者认为这阻碍了共享视觉语言表征与构建通用机器人智能体(第 1–3 页)。
本文的核心假设是:两个任务都依赖从视觉和语言中抽取目标、空间关系与时序意图,因此共享主干、联合训练可以产生正迁移;异构动作空间则可由统一输出头和训练时的选择性监督来处理。
方法
输入与双输出
模型每一时刻接收多视角 RGB 图像、自然语言指令及可选机器人状态,输出文本解释与未来一段动作序列:
(视觉观测, 指令, 机器人状态) → (文本理解/推理, 未来动作)
它用 <text>...</text><action>...</action> 标记先自回归生成的文字和后续动作。视觉编码器为 32 层 ViT,将 14×14 图像块编码并投影到 2048 维;语言模型为 36 层 Transformer。论文将文本输出定位为对任务理解和将要执行动作的解释(第 3–5 页)。
统一 11 维动作头
统一动作向量为 a_unified = [a_navigation | a_manipulation]:
- 导航部分(4 维):
forward、turn left、turn right、stop的概率分布。 - 操作部分(7 维):末端执行器的
Δx, Δy, Δz, Δroll, Δpitch, Δyaw与夹爪g。
动作头采用 DiT(Diffusion Transformer)式的流匹配生成:从噪声动作轨迹出发,条件于视觉语言隐状态预测速度场,再用 Euler 积分逐步去噪成未来动作。对于导航样本,只让导航维度进入动作损失;对于操作样本,只让 7 维操作量进入损失。停止动作等稀有关键维度可提高权重,而填充维度权重近零(第 4–6 页)。因此“统一”指同一套骨干和同一个固定维度动作头,并不表示一次为同一输入同时执行导航与操作两种控制。
三阶段渐进训练
- 建立操作能力:混合跨具身操作数据和通用 VQA 数据,学习连续 7-DoF 控制并保持视觉语言理解。
- 引入导航并联合训练:在保留操作与 VQA 数据的同时加入 VLN 数据;共享主干、分别掩码计算两个动作子空间的损失。
- CoT 精炼:加入思维链数据,额外监督文本推理序列,以提升跨任务决策。
总体损失由通用视觉语言交叉熵、具身文本推理交叉熵和带掩码的流匹配动作损失加权组成。训练采样中导航数据与操作数据的比例为 6:4;论文报告的损失权重为 λ_action=1、λ_text=λ_vlm=0.1(第 6–8 页)。
实验与结果
仿真设置
导航在 Habitat 的 VLN-CE 上测试 R2R 与 RxR 的 val_unseen,主要指标为 OSR(oracle success rate);操作在 SimplerEnv-Bridge 中、使用 WidowX/Bridge 平台,测试“勺子放毛巾、胡萝卜放盘子、绿方块叠黄方块、茄子放黄篮”四项任务,各运行 24 次,报告成功率(第 7 页)。
主结果
表 1 报告 OneVLA(3B)在 R2R、RxR 的 OSR 分别为 68.6%、58.2%;四项 SimplerEnv 任务的成功率为 87.5%、37.5%、50.0%、83.3%,平均 64.5%(第 8 页)。
按论文表内对比:
- 相对需任务专用动作头微调的 UniVLA,R2R 提升 21.5 个百分点(68.6 vs. 47.1),RxR 提升 31.9 个百分点(58.2 vs. 26.3),SimplerEnv 平均成功率提升 29.1 个百分点(64.5 vs. 35.4)。
- 与表中单任务导航模型相比,R2R 超过 StreamVLN 的 64.0,RxR 超过 StreamVLN 的 55.7;与表中操作模型相比,平均成功率高于 π0-Fast 的 48.3。上述是作者基于汇总表作出的 SOTA 比较,具体训练数据、评测实现与模型规模并不完全相同(第 8–9 页)。
消融与真机
- 渐进训练:与在完整数据上单阶段训练相比,三阶段训练使 R2R 从 56.1 升至 68.6、RxR 从 42.9 升至 58.2、SimplerEnv 平均 SR 从 46.2 升至 64.5(第 9 页,表 2)。
- 跨任务联合训练:相较于单任务训练,单阶段联合训练使 R2R 提升 7.3 个百分点、RxR 提升 9.3、SimplerEnv 平均 SR 提升 5.5(第 9 页,表 3)。这支持联合训练可带来正迁移的主张。
- 动作预测长度:预测 5 步动作取得最佳的 R2R(68.6%)和 SimplerEnv(64.5%)成绩;长度 8 时操作成绩降至 50.3%,作者将其归因于长序列预测更难、误差累积(第 10 页,图 4)。
- 真机:作者使用 Franka Research 3 做四类操作任务(每类 20 次),并以移动机器人测试四个导航场景(每场景 10 次)。OneVLA 的操作成功率为 78.8%、导航成功率为 77.5%;图 5 标示其分别较 UniVLA 高 16.3 和 35.0 个百分点(第 10 页)。
贡献与局限
主要贡献
- 以固定 11 维输出、单个流匹配动作头和任务掩码,统一离散导航与连续操作动作,而不为两任务设置模型变体。
- 提出从操作能力、到导航-操作联合学习、再到 CoT 的渐进式训练配方。
- 在文中所用的导航、操作仿真基准及真机实验上报告了优于其对比模型的结果,并通过消融展示任务间正迁移。
局限与适用范围
论文未单列局限章节;以下是从其设定可直接得出的边界。
- 仅覆盖离散室内 VLN 与单臂 7-DoF 操作两大类任务;未评估移动操作中导航和机械臂需要在同一长程任务中协同切换的情形。
- 11 维拼接与掩码解决了输出层的异构性,但导航、机械臂、相机与不同执行频率的控制接口仍需预先标准化;跨更多本体或双臂/全身控制的效果尚未明确说明。
- 模型一次生成文本推理和动作,论文没有给出推理延迟、动作频率、文本生成失败如何影响控制、或安全约束机制的定量分析。
- 真机评测的总次数有限(操作 80 次、导航 40 次),未报告置信区间、失败类型或跨地点/跨设备的系统性泛化统计。
- 所谓“首个”统一框架与 SOTA 结论依赖论文选取的比较定义和汇总表;更严格的公平比较需要统一数据、动作频率、模型容量与评测协议。
批判性阅读
表 2 和表 3 分别把渐进训练、联合数据训练的影响拆开测量,因而对“联合训练存在正迁移”和“课程顺序有帮助”提供了直接证据。动作长度消融也表明结果不是通过无约束地增加预测步数取得的。
不过,统一动作头本身的独立贡献没有被单独量化:缺少“共享骨干 + 两个专用动作头”与“11 维统一头 + 掩码”在完全相同训练数据和参数预算下的直接消融。文本 CoT 的质量和它与动作成功率的因果关系也未被细分报告。因此,现有证据足以说明这套整体配方有效,但不足以精确归因每一结构设计的收益。
值得进一步追问:
- 把导航动作改成分类分支、操作动作保留流匹配分支,是否能以相同参数量达到同样成绩?
- CoT 是否在推理时必需?移除生成文本、只保留内部隐状态会如何影响成功率、时延与安全性?
- 联合训练的收益来自共享视觉语言知识,还是来自更多样的数据、更多总训练 token?若固定每个任务的数据量并匹配训练 token,结论是否仍成立?
- 当任务要求“先导航、再抓取、再继续移动”时,同一模型如何处理阶段切换、记忆与失败恢复?
可复用启发
- 将多任务动作填入统一的最大维度表示,并采用样本级掩码,是在不牺牲各自损失定义的前提下实现共享策略网络的实用手段。
- 多任务训练应将“共享骨干所带来的表征迁移”与“数据量、采样比例、训练步骤增加”分开做对照,才能明确正迁移来源。
- 若希望让语言推理提升机器人行为,除最终成功率外,还应评估推理是否忠实、是否及时,以及推理与实际动作不一致时的安全降级策略。
- 5 步动作预测优于过短和过长窗口,提示规划/控制系统需要选择适中的动作分块长度,并配合闭环重观察而非无限延长开环序列。
术语与关键证据
- VLA(Vision-Language-Action):把视觉观测和语言指令映射到机器人动作的多模态策略模型。
- Flow matching:学习从噪声分布流向目标动作分布的速度场,用迭代积分生成连续动作序列。
- 任务维度掩码:训练时让不同任务只对统一动作向量中对应维度产生梯度的掩码。
- OSR(Oracle Success Rate):轨迹中曾在成功距离阈值内到达目标即记成功的导航指标;它不同于最终停止位置的成功率,解读时应留意。
- 关键证据:联合训练的 R2R/RxR/SimplerEnv 指标为 56.1/42.9/46.2,单任务训练则分别为 48.8/33.6/40.7(第 9 页,表 3);动作预测长度为 8 时 SimplerEnv 降至 50.3%(第 10 页,图 4)。