Skip to content

Uni-NaVid:统一具身导航的视频视觉语言行动模型

Zhang, J. et al. Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks. RSS 2025. 论文 · 项目主页 · 代码

三个问题

1. 论文解决了什么问题?

论文要解决具身导航模型按任务分别设计、依赖固定地图或离散路点,因而难以在真实环境中统一完成跟随指令、找物、问答和跟随人物的问题。

2. 作者解决问题提出了什么方法?

作者提出统一的视频 VLA:以 RGB 视频和语言为共同输入,以动作或回答为输出;在线 token 合并压缩长视频历史,Vicuna-7B 一次预测未来四步动作,并用四类导航数据联合训练以促进任务间迁移。

3. 对我有什么启发?

构建通用导航智能体时,可以先统一任务的输入输出接口,再通过多任务数据共享场景理解和时序技能;同时,长程能力不只依赖扩大上下文,更需要分层压缩近期与远期视觉记忆。

一句话总结

Uni-NaVid 将第一视角 RGB 视频和语言指令统一为同一种输入,并以低层动作或文本回答作为输出,让单个视频 VLA 模型同时处理 VLN、对象目标导航(ObjectNav)、具身问答(EQA)和人类跟随,并能组合执行多类任务。

问题与贡献

已有导航系统通常按任务单独训练,或依赖预定义地图和离散路点,因此难以成为真实环境中的通用导航器。Uni-NaVid 用统一的“视频 + 指令 → 动作/回答”接口整合四个任务:任务间可共享场景理解、语言 grounding 与运动技能;其训练集包含 360 万条导航样本,并混合视频问答、视频描述等互联网数据以保留开放世界语义能力。

方法

模型由 EVA-CLIP 视觉编码器、在线 token 合并模块和 Vicuna-7B 语言模型组成。每帧先提取视觉 token;模块将近期帧保留得更细、将较久历史按时间与空间相似度压缩,在控制上下文长度的同时保留路径记忆。合并后的视觉 token、任务标记与指令共同送入 LLM:导航时一次预测未来 4 个离散动作(前进、左转、右转、停止),问答时输出语言答案。

结果与意义

  • 在线压缩将平均推理时间降至约 0.2 秒(约 5 Hz);四步预测允许机器人在执行已有动作时并行处理新观察,支持非阻塞部署。
  • 在 R2R/RxR VLN、ObjectNav、EQA 和人类跟随等基准上达到或接近最优表现;官方代码报告 R2R Val 的 SR 51.8、SPL 47.7,RxR Val 的 SR 56.1、SPL 44.5。
  • 多任务训练总体优于各任务单独训练,说明“导航—找物—提问—跟随”之间确有可迁移的视觉语言与时序技能。

局限与启示

当前模型只覆盖四类定义明确的任务,并假定标准机器人尺寸;动作仍是短视野、离散的低层序列。面向跨楼层、复杂动态环境或不同机体时,仍需要更长程的空间记忆、连续运动规划和更广泛的多机器人数据。