AerialVLN:面向无人机的视觉语言导航
Liu, S. et al. AerialVLN: Vision-and-Language Navigation for UAVs. ICCV 2023, pp. 15384-15394. 论文|代码与数据
一句话总结
论文提出首个面向城市级室外环境的无人机视觉语言导航(VLN)基准 AerialVLN:智能体根据长篇自然语言指令,在连续三维空间中完成飞行、避障与到达目标。实验表明,传统地面 VLN 方法在此任务上远落后于人类,说明空中长程导航仍是困难问题。
问题与挑战
以往 VLN 多针对室内或地面移动;四旋翼无人机则需要理解高度、俯仰和更复杂的三维相对位置。相较地面任务,AerialVLN 的关键困难包括:
- 动作空间更大:除前进、转向外,还需上升、下降、抬头/低头,且可在不转向时横向移动。
- 长程且开放:路径平均 661.8 米、约 204 个动作;指令平均 83 词,常含多个地标、顺序和空间关系。
- 连续三维避障:无人机需估计障碍物形状与距离,而不是在离散候选节点间跳转。
数据集与环境
作者基于 Unreal Engine 4 和 AirSim 构建近真实感连续模拟器,包含 25 个城市级场景(城区、工厂、公园、村庄等)和 870 余类物体。AOPA 持证飞手采集 8,446 条飞行轨迹,每条轨迹由众包标注者配套 3 条指令,共 25,338 条指令;轨迹子段与子指令也对齐,可用于细粒度跨模态学习。
完整数据集按场景划分:训练/验证已见使用 17 个场景,验证未见与测试未见各使用 8 个场景。另提供 AerialVLN-S:17 个更小场景、平均路径缩短 51.5%,适合更一般的第一视角三维导航研究。
方法:Look-ahead Guidance(LAG)
论文以 Seq2Seq 和跨模态注意力模型(CMA)为基线。CMA 使用 RGB、深度、指令和历史动作,并通过注意力对齐当前观察与语言。
作者指出,常见 student-forcing 会让偏离轨迹的智能体直接学习“回终点的最短路”,但人类指令通常要求经过指定地标,并不描述最短路。LAG 的做法是:先回到演示轨迹最近处,再沿演示轨迹向前看 10 步,把该位置作为临时目标;从当前位置到临时目标的最短路径的第一步即为监督动作。这样既允许纠偏,又保留“按指令经过地标”的意图。LAG = CMA + 这种前瞻式动作标注。
实验结论
评估使用导航误差(NE,越低越好)、成功率(SR)、Oracle 成功率(OSR)和路径匹配指标 SDTW(后三者越高越好)。完整 AerialVLN 的未见环境中,Seq2Seq 与 CMA 的 SR 只有 1.0%–1.6%;测试未见集上的人类 SR 为 80.8%,差距显著。随机策略 SR 为 0%。
在较简单的 AerialVLN-S 上,CMA 的测试未见 SR 为 3.9%,LAG 提升至 4.5%,并提升 SDTW;数据聚合(DA)也能缓解训练与测试时状态分布不一致的问题。结论不是“LAG 已解决导航”,而是它证明:对长程具身任务,监督信号应保留人类路线和语言所表达的中间意图。
启发与局限
- 该工作的重要价值在于提供了空中 VLN 的可复现任务、连续仿真器和强挑战基线,而非提出高成功率模型。
- 主要瓶颈是长时程记忆、地标消歧、全局三维空间表征、稀疏成功反馈与未见城市的泛化。
- 模拟环境和深度输入降低了现实部署难度;后续工作仍需处理 sim-to-real、传感器噪声、动态对象和真实飞行安全约束。
可复现提示
官方实现要求 Ubuntu、NVIDIA GPU、Python 3.8+、AirSim 和约 35 GB 的模拟器资源。研究时应优先报告未见场景结果,并明确所用版本(AerialVLN 或 AerialVLN-S)、动作空间与成功阈值,避免只比较已见环境。