Skip to content

OmniVLA:统一语言、位姿与目标图像的全模态导航 VLA

Hirose, N., Glossop, C., Shah, D., Levine, S. OmniVLA: An Omni-Modal Vision-Language-Action Model for Robot Navigation. arXiv:2509.19480v1, 2025. 论文项目页

三个问题

1. 论文解决了什么问题?

导航机器人可用语言、目标图片、GPS/二维相对位姿等多种方式表达目标,但多数策略只为单一目标模态训练。结果是可训练数据被标签类型限制,测试时也难以结合“去这个坐标,同时沿墙走”之类互补信息。OmniVLA 要训练一个策略,在目标模态缺失、组合或切换时仍可导航,并能从跨平台异构数据中学习。

2. 作者解决问题提出了什么方法?

作者以 OpenVLA 为骨干,为自车当前图像、目标图像、二维目标位姿和语言提示分别编码并投影到共享 token 空间,再输出 8 步动作块。训练时对每个样本随机选择可用目标模态,以注意力掩码屏蔽其余随机填充值;这种 modality dropout 让模型在不同数据集的模态不完整、不均衡时学习统一表示,也支持在推理时同时输入多种目标信息。

3. 对我有什么启发?

与其为语言、图像和地理坐标分别训练互不兼容的导航器,更有效的是将它们视作对同一“目标状态”的不同约束,并在训练中故意制造缺失模态。关键不只是简单拼接输入,而是让模型见过所有可用组合、明确屏蔽无效 token;这样新传感器或新目标表达可通过替换小型编码器和少量数据适配。

一句话总结

OmniVLA 用随机模态融合把语言、2D 位姿和第一视角目标图像统一到一个导航 VLA 中,利用约 9,500 小时、10 种平台的公开导航数据预训练。在真实评测中,7.5B OmniVLA 的语言、位姿、图像单模态成功率分别为 0.73、0.95、1.00,并能在“远处位姿 + 行为语言”组合任务中同时满足到达与跟随要求(表 II、IV)。

问题与动机

语言适合描述目标语义和行为约束,第一视角目标图像适合近距离视觉对齐,GPS/二维位姿则适合长距离室外目标。单模态训练一方面浪费只带部分标签的大量数据,另一方面迫使用户在不同场景切换策略。作者假设这些信号包含互补的几何、视觉和语义信息:联合训练会改善目标表征,也能使策略在任意一类信息缺失时保持可用(第 I、III 节)。

方法:全模态目标条件导航

1. 基于 VLA 的共享 token 架构

主模型建立在 OpenVLA 的 7B VLA 上,总计约 7.5B 参数。当前自车图像经视觉编码器处理;目标图像、2D 目标位姿与语言提示各自经编码器/投影器转换为 token,再与当前观察共同送入 LLM。线性动作头输出 N=8 个未来动作,训练与控制频率为 3 Hz,对应约 2.4 秒动作块。论文同时给出 50M 参数的 OmniVLA-edge:它以 ViNT 为导航骨干,以早期融合接入位姿、图像和语言,面向资源受限部署(第 3.1 节、附录 A)。

2. 随机模态选择与掩码

每个训练样本只从其可用的目标模态中随机采样一个或多个组合;未选或数据集中不存在的模态会填入随机值,并由 attention mask 屏蔽,确保策略不会依赖占位内容。因而 GNM、LeLaN、Frodobots-2K、BDD-V 等标签不齐全的数据都可参与训练,而模型同时学习单模态与组合模态目标条件(第 3.2 节)。

3. 异构数据与动作再标注

训练混合了 13 个公开数据集、约 9,500 小时、10 种平台的导航经验:GNM 混合数据侧重图像/位姿,LeLaN 提供语言与合成标签,Frodobots-2K 提供街道数据,BDD-V 则提供大规模驾驶视频。为缩小汽车与小型机器人的动作尺度差,作者以 MBRA 为 Frodobots 和 BDD-V 生成/修正可执行轨迹;LeLaN 使用 NoMaD 生成动作。主目标是 8 步动作模仿损失,语言数据另加入最终动作朝向目标物体的损失以及动作平滑正则(表 I、第 3.2 节)。

实验与结果

真实评测覆盖语言、2D 位姿和目标图像导航:语言目标距起点 5-30 m,包含办公室、厨房、公园与人行道;位姿目标距离 25-100 m,以 GPS 计算相对位姿;图像目标近距离为 3 m,远距离则辅以拓扑记忆。作者使用 FrodoBots ERZ 机器人,并测试 VizBot 轮式机器人与 Unitree Go1 四足机器人上的跨形态迁移(第 4 节)。

  • 单模态表现:完整 OmniVLA 的语言 SR 为 0.73,OOD 行为指令遵从率为 0.65;2D 位姿 SR/进展为 0.95/0.98;目标图像 SR/进展为 1.00/1.00。它优于语言专用 LeLaN(语言 SR 0.43)、位姿专用 MBRA-pose(0.86/0.92)及图像专用 NoMaD(0.63/0.77)(表 II)。
  • 组合目标:在 10 个未见的“目标位姿说明去哪里、语言说明怎样走”任务中,OmniVLA 达到 0.80 SR、0.86 进展和 0.60 行为遵从率;模型能同时利用坐标与如“沿墙走”“从两个物体之间穿过”的 OOD 语言约束,而小型 OmniVLA-edge 与其他 VLA 未能完成该组合任务(表 IV)。
  • 适配新模态与环境:从未见过卫星目标图像的预训练模型,仅替换并训练目标图像编码器后,将该任务 SR 从卫星图像专用策略的 0.19 提升到 0.62。再用 1.2 小时含卫星图像和 2D 位姿的新环境数据微调,卫星图像 SR/进展由 0.57/0.75 提升到 0.83/0.92,2D 位姿由 0.81/0.90 升至 0.86/0.96(表 V)。
  • 适配语言数据与机器人形态:用 CounterfactualVLA 的新语言数据微调后,语言 SR/行为遵从/简单场景成功/障碍场景成功从 0.725/0.650/1.000/0.647 提升至 0.825/0.700/1.000/0.765。论文还展示策略零样本部署到安装不同相机的 VizBot 与 Go1,能按语言到达目标(第 5.3 节)。

局限与批判性阅读

论文结论明确表示语言条件导航仍有提升空间,尤其是目标到达和指令遵从,且需要规模更大、标注更精细的数据(第 VI 节)。更具体地看,数据混合依赖合成语言标签与 MBRA/NoMaD 再标注动作,其误差可能向端到端策略传播;语言模态在训练混合中远少于驾驶/位姿数据,尽管靠采样比例平衡,真实开放指令仍可能超出覆盖范围。主模型 7.5B 的在线部署成本也未报告具体延迟,论文因此需要 50M 的 edge 版本;而跨形态部分主要是演示,缺少与 ERZ 同等规模的定量成功率。卫星模态适配说明可迁移性,但仍需要目标表示相对简单且有小规模配对数据。

与现有 VLN 笔记的关系

Uni-NaVid 以视频 VLA 统一多类具身导航任务,NaVILA 用中层语言动作连接高层 VLA 与腿式行走;OmniVLA 则统一的是“目标怎么表达”,让同一动作策略接受语言、目标图像和地理位姿。它与 ULVN 的关系也很直接:ULVN 的拓扑图可把长距离目标拆成局部目标图像,OmniVLA 则可作为执行这些图像子目标、并同时吸收语言或位姿约束的局部控制器。

术语与关键证据

  • 全模态目标条件(omni-modal conditioning):将多种可同时出现或缺失的目标表达输入同一策略。
  • 2D goal pose:目标相对机器人的平面位置/朝向线索,适合 GPS 可用的长距离导航。
  • modality dropout:训练时随机保留一部分可用模态,并用注意力掩码忽略其他 token 的训练策略。
  • MBRA reannotation:用模型把原始轨迹转换为目标机器人可执行的动作标签,扩大跨平台数据的可用性。