OpenUAV:面向真实无人机视觉语言导航的平台、基准与方法
Wang, X. et al. Towards Realistic UAV Vision-Language Navigation: Platform, Benchmark, and Methodology. ICLR 2025. 论文|代码与数据
一句话总结
OpenUAV 指出,直接把地面 VLN 的离散动作设定套到无人机上,会忽略连续六自由度飞行、姿态动力学与三维避障。论文因此从平台、数据集、协助式评测和模型四个层面构建更贴近飞行过程的 UAV VLN 闭环,并以分层多模态大语言模型生成长程目标姿态与短程可执行轨迹。
问题:UAV VLN 与地面 VLN 有何不同
无人机在开放三维空间中飞行,既要沿语言寻找目标,又必须处理高度、偏航、俯仰、滚转、碰撞和连续控制。地面导航常见的“从若干离散候选节点中选一步”不再足够:局部感知会遮挡目标,直接预测很长的连续轨迹也易累积误差。论文将困难概括为三类:真实飞行动态、目标搜索的不确定性、以及从全局计划到局部避障的跨尺度决策。
OpenUAV 平台与数据
OpenUAV 基于 Unreal Engine 4 与 AirSim,提供 22 个城市场景和自然场景、89 类可配置物体,并支持向场景动态加入资产。平台模拟连续 6 DoF 飞行与多视角视觉观测,而非仅使用预定义节点。
作者据此构建目标导向 UAV VLN 数据集,约 12,149 条轨迹—指令对。轨迹由人工操控收集,目标是进入物体约 5 米范围;初始描述从多视角图像生成后由人工审核。路径长度约覆盖 50–400 米,因而同时包含目标识别、远程飞行和末端接近。
UAV-Need-Help:将协助作为评测变量
仅给目标描述时,无人机常因视野受限、目标遮挡或复杂结构而失败。UAV-Need-Help 通过三档辅助信息评估“需要帮助时能否利用帮助”:
- L1:持续辅助,提供高频、接近专家轨迹的飞行提示。
- L2:困难触发辅助,在偏离轨迹或存在碰撞风险时介入。
- L3:危险触发辅助,仅在接近障碍时给出安全相关提示。
该设置不是声称真实系统永远有助手,而是把人机协作强度显式化,用来研究模型在信息逐步减少时的退化与恢复能力。
方法:UAV Navigation LLM
模型将任务描述、助手提示和多视角图像一起输入多模态大语言模型,并采用分层轨迹生成:
- 高层目标姿态解码器根据整体语义预测远距离目标姿态,负责全局方向。
- 低层路径解码器利用前视视觉和姿态特征生成细粒度轨迹,负责局部避障与控制。
这样的分工避免直接从语言一次生成完整连续航迹。训练还使用基于回溯采样的数据聚合:若模型动作导致碰撞,就退回前若干帧并沿教师轨迹恢复,借此补充“偏离正确路线后如何纠正”的样本,缓解 teacher forcing 与实际执行的差异。
实验结论
论文显示,所提 UAV Navigation LLM 在不同辅助等级下优于对比模型,但与人类操作者仍有显著差距。结论有两层:
- 多视角感知、语言与分层轨迹预测的组合,对连续 UAV 导航有效;纯粹的单尺度端到端动作预测难以同时完成远程搜索和近距离控制。
- 随辅助从 L1 降到 L3,任务显著变难;这说明当前 UAV VLN 仍高度依赖外部信息,安全感知和自主目标搜索是核心瓶颈。
启发与局限
- 价值:将“真实飞行动力学”和“辅助式目标搜索”引入 VLN 评测,弥补了早期空中基准偏离实际控制的问题。
- 局限:平台仍是仿真环境;视觉域差、风扰、定位误差和真实飞控延迟尚未被完整覆盖。
- 局限:协助信息的格式、频率和触发逻辑会显著影响性能,因此比较时必须报告具体等级与提示协议。
- 后续方向:从仿真到真机迁移、学习何时请求帮助、以不确定性驱动的风险控制,以及在弱辅助下构建全局语义地图。
可复现提示
官方项目名为 TravelUAV。运行时需准备 OpenUAV 环境、数据、模型权重与 CUDA/PyTorch 依赖;复现实验应固定辅助级别、碰撞判定、目标成功半径、动作频率和是否使用回溯数据聚合,避免将不同交互条件下的结果直接比较。