Skip to content

NaVILA:用于导航的腿式机器人视觉语言行动模型

Cheng, A.-C. et al. NaVILA: Legged Robot Vision-Language-Action Model for Navigation. RSS 2025. 项目页论文代码

三个问题

1. 论文解决了什么问题?

论文解决自然语言导航决策与腿式机器人高频关节控制之间的鸿沟:VLM 擅长语义规划,却难以直接稳定、安全地输出连续运动控制。

2. 作者解决问题提出了什么方法?

NaVILA 采用两层架构,高层 VLA 根据指令和视频生成带方向与距离的中层语言动作,低层视觉行走策略再通过强化学习将其转为实时运动、避障和稳定控制,并用 VLN-CE-Isaac 连接语言导航与物理仿真评测。

3. 对我有什么启发?

具身系统不必追求从语言到关节力矩的完全端到端映射;选择可解释、可检查的中层动作接口,能够把通用模型的语义能力与专用控制器的安全实时性有效结合。

一句话总结

NaVILA 面向四足和人形机器人的视觉语言导航,提出两层系统:视觉语言行动模型(VLA)把指令和视频观察转成“向前 75 cm”“左转”等带空间量的中层语言动作,视觉低层行走策略再把它稳定、安全地落实为腿部控制。该解耦让系统同时获得 VLM 的语言理解与强化学习控制器的实时避障能力。

问题:从自然语言到关节力矩的鸿沟

传统 VLN 常在仿真中选择离散导航节点,或把高层动作交给预训练航点预测器;腿式机器人实际需要连续低层控制,还要面对障碍、地形、透明物体、视角变化和控制延迟。若让 VLA 直接预测每个关节动作,会遇到动作频率高、数据稀缺、误差累积和 sim-to-real 差距等问题。

NaVILA 的核心判断是:语言模型擅长给出“去哪里、朝哪里、走多远”的语义空间指令,却不适合毫秒级运动控制;低层策略擅长局部反应,却不理解复杂长指令。二者应通过中层接口连接。

方法:两层 Vision-Language-Action 框架

高层:语言化的中层动作

高层 VLA 输入自然语言与历史 RGB 视频帧,输出如 forward 75 cmturn leftstop 的空间动作。动作仍是文本/结构化语言形式,而不是关节角度;因此 VLA 可利用通用视觉语言预训练,且输出更易解释、检查和替换。

模型在混合数据上训练:真实人类游览视频、模拟室内 VLN 轨迹,以及视觉问答/三维问答数据。这样既学习自然场景和人类移动的视觉多样性,也保留指令跟随与空间理解能力。

低层:视觉行走与避障策略

低层策略接收当前视觉观察和高层中层命令,输出可执行的运动控制。该策略用强化学习训练,在训练时可利用 LiDAR 与环境交互学习安全运动;部署时使用视觉输入,以降低对昂贵传感器和精确地图的依赖。它负责在遵从中层目标的同时绕开障碍、适应粗糙地面并维持机体稳定。

接口的意义

中层指令是信息瓶颈:它向下传递与任务相关的局部目标,而不把高层模型的视觉误识别、低频推理或冗长上下文直接放进控制环。低层也能在局部安全约束下修正高层命令的具体执行路径。

新基准:VLN-CE-Isaac

论文构建 VLN-CE-Isaac,用 Isaac Sim 将连续环境 VLN 与带物理的低层腿式控制连接起来。基准支持不同机器人形态和复杂场景,以较低风险、可扩展的方式评估“语言导航 + 真实运动学/动力学”,弥补 Habitat 等基准中智能体近似漂移或直接移动的局限。

实验结论

NaVILA 在 R2R-CE、RxR-CE、VLN-CE-Isaac 与真机环境上评估。论文主要结论为:

  • 在只使用单视角 RGB、且不依赖仿真预训练航点预测器的条件下,NaVILA 在连续 VLN 基准上超过同类方法;R2R-CE val-unseen 报告 SR 54.0、SPL 49.0、NE 5.22,RxR-CE 报告 SR 49.3、SPL 44.0、nDTW 58.8
  • 在 VLN-CE-Isaac 中,视觉低层策略比无视觉(blind)策略更可靠,尤其体现在绕开局部障碍物。
  • 系统在 Unitree Go2、Booster T1 和 Unitree G1 上进行了真实环境演示,覆盖办公区、家庭和室外场景,说明同一高层接口可跨四足与人形形态复用。

这些结果支持“语言规划与身体技能分离”的设计,但并不代表系统已具备开放世界的完全自主性。

局限与启发

  • 高层空间动作的精度决定下层目标质量;若语言模型错误识别地标,低层安全控制只能避免碰撞,不能保证到达正确地点。
  • 低层 RL 策略仍依赖仿真训练和特定机器人形态,跨硬件、极端地形与动态人群的泛化仍需验证。
  • 人类游览视频扩展了视觉数据,但视频中的相机运动、标注质量和机器人视角并不完全一致。
  • 论文的启发是:具身 VLA 不必端到端输出最低层动作。选择恰当的中层抽象(距离、方向、子目标)可以兼顾通用模型的语义能力与控制策略的安全、实时性。

可复现提示

官方仓库分别提供 VLA、低层 locomotion 和 VLN-CE-Isaac 资源。评测 R2R/RxR 连续导航需要旧版 Habitat/VLN-CE 兼容环境;训练与推理应明确视频历史长度、所用高层 checkpoint、机器人类型、视觉/盲策略以及是否使用 LiDAR 训练特权信息。