Skip to content

NaVid:基于视频的 VLM 为视觉语言导航规划下一步

Zhang, J. et al. NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation. RSS 2024. 论文 · 项目主页 · 代码

三个问题

1. 论文解决了什么问题?

论文针对连续 VLN 对地图、深度和里程计的依赖,以及这些输入带来的传感器噪声和 Sim2Real 差距,探索只用单目 RGB 进行通用导航。

2. 作者解决问题提出了什么方法?

作者提出基于 LLaMA-VID 的视频 VLM,将自然语言指令和在线 RGB 视频历史直接映射为下一步低层动作,并通过导航动作规划、指令推理和网页数据混合训练获得时空理解与泛化能力。

3. 对我有什么启发?

视频历史可以作为不依赖显式位姿的隐式状态,但长程任务仍应配合自适应记忆压缩、动作不确定性和轻量空间结构,避免把所有历史简单堆入上下文。

一句话总结

NaVid 将连续的第一视角 RGB 视频和自然语言指令直接映射为下一步低层导航动作,用视频历史替代显式地图、里程计与深度输入,以提升未见环境及仿真到真实(Sim2Real)场景的泛化能力。

问题与动机

传统连续环境 VLN 往往依赖深度、位姿或构建的地图;这些信号在真实机器人上会有噪声,且与仿真输入存在分布差异。只看当前单帧又会丢失已走过的路径与转向线索。NaVid 采用机器人在线采集的单目 RGB 视频流,将历史观察编码为时空上下文,模仿人类“边看边走”的决策方式。

方法

在时刻 $t$,模型输入指令和截至当前的视频帧序列,输出下一步动作。它以 LLaMA-VID 为基础,并加入面向导航的设计:保留视频中的几何信息,使语言模型能够根据指令推断前进距离与转向等定量动作。整个闭环只使用 RGB 视频,因此不需要额外的地图、里程计或深度传感器。

训练与实验结论

  • 训练混合了 51 万条连续环境导航样本(含动作规划、指令推理样本)和 76.3 万条大规模网页数据,兼顾导航动作学习与通用视觉语言知识。
  • 论文在模拟基准与真实机器人实验中报告了领先结果,并显示出较强的跨数据集迁移和 Sim2Real 能力。
  • 关键贡献不只是使用 VLM,而是将视频历史作为策略状态:它提供了隐式记忆,又避免把容易失配的显式传感器输入作为前提。

局限与启示

RGB-only 方案仍会受弱光、遮挡和视觉纹理不足影响;长视频也会增加上下文与推理延迟,且模型没有显式可审计的全局地图。后续工作可结合自适应视频记忆、动作不确定性估计和轻量空间记忆,在保留端到端泛化优势的同时提高长程可靠性。