AerialVLA:具备在线对话的空中视觉语言行动模型
Chen, J. et al. AerialVLA: A Vision-Language-Action Model for Aerial Navigation with Online Dialogue. AAAI 2026, pp. 18161-18169. 论文|代码
一句话总结
AerialVLA 面向“人可在飞行过程中继续给指令”的无人机视觉对话导航:无人机不仅根据图像和对话决定下一步飞行,还能在判断自己可能走偏或信息不足时主动提问。论文的关键是用进度驱动的“导航—提问”交替机制、带空间位置的历史记忆,以及基于行动的在线数据增强,把对话、感知、决策连接为一个端到端闭环。
问题:为什么仅记录对话历史不够
传统 UAV 视觉对话导航(VDN)通常被动接收人类对话,按顺序保存历史观察。它有两个缺陷:
- 无人机不能在出错或歧义出现时自行决定提问,只能持续执行,难以在线纠偏。
- 新指令常会引用过去见过的地标,例如“回到前一个十字路口后左转”。按时间堆叠图像很难回答“哪个历史画面、在什么相对位置”的问题。
因此,任务不是单纯的 VLN,而是部分可观测条件下的主动信息获取 + 长时程空间记忆 + 飞行动作预测。
方法概览
AerialVLA 是端到端框架,统一输入当前视觉、历史观察和对话上下文,输出水平位移、垂直位移、停止概率,或向人类提出导航问题。官方实现基于 LLaVA OneVision / Qwen2-7B-Instruct,并使用 9×9 平面网格和 20 个高度档位对动作离散化。
1. 历史空间—时间融合(HSTF)
模型先按无人机地理位置把历史鸟瞰观察拼接为逐步扩展的全局地图;这保留了“看过什么、相对在哪里”的空间关系。随后,空间—时间注意力(STA)把每个历史时刻的视觉特征与全局地图上的多尺度局部区域对齐,并保留访问顺序。这样,当用户提到“刚才的桥”或“上一个路口”时,模型能同时利用地标位置和经过次序,而非只搜索相似图片。
2. 进度驱动的导航—查询交替(PNaQ)
动作与语言生成容易相互干扰,论文为两者使用专门预测头和任务 token:[act] 触发动作预测,[que] 触发问题生成。每个时刻先预测动作;“询问”被视为可选动作。若选择询问,再生成面向当前不确定性的导航问题并等待用户回应。
核心思想是以估计的导航进度判断何时继续、何时求助:不把对话固定在预设轮次,而让模型把提问当作代价有限、可用于纠偏的决策。图中的典型例子是无人机到达路口且进度变差时询问左右方向,用户据此要求返回并转向。
3. 在线任务驱动增强(OTDA)
真实 UAV 对话导航标注有限,训练时只依赖专家轨迹会产生暴露偏差。OTDA 按模型执行的动作生成额外训练样本,覆盖偏离专家路线后的状态,使模型学习在错误状态下恢复、继续导航或发起询问。代码实现采用 DAgger 式迭代自训练来产生此类数据。
UNOD:在线对话评测
论文提出 UAV Navigation with Online Dialogue(UNOD) 评测设置。它不只测离线轨迹成功,还在测试过程中接入在线对话模块,并用 Air Commander LLM 模拟人类导航员的回答,从而检验两个能力:
- 是否在合适时刻提出有用问题;
- 获得回答后是否真正改善飞行路径。
这是对传统固定对话历史评测的重要补充,但 LLM 模拟用户的可靠性、提示词和回答一致性会影响结果,应在复现实验中单独报告。
实验结论
论文在 UAV VDN 基准上报告 AerialVLA 达到最优导航表现,同时具备有效的主动对话能力。消融结果支持三个判断:空间—时间历史融合优于简单顺序记忆;按进度触发提问优于固定或被动对话;动作条件增强有助于缓解训练与真实执行的状态分布差异。
评价时应联合查看 SR(成功率)、TC(轨迹完成率)、SPL(路径效率)与进度 IoU,而不能只看最终是否到达:一个频繁提问的系统可能提高成功率,却牺牲路径效率和交互负担。
启发与局限
- 启发:对话应是导航策略的一部分。何时提问、问什么、如何将回答落到地图和动作,三者需要联合优化。
- 启发:长期记忆不应只是更长的 token 序列;显式空间地图与时间顺序对处理指代语句很关键。
- 局限:问句质量和用户回答质量会直接影响闭环;UNOD 的 LLM 用户模拟不能完全替代真实人机试验。
- 局限:离散网格与高度动作简化了控制,尚不能直接证明对连续飞行控制、动态障碍物和安全约束的适用性。
可复现提示
官方代码基于 AVDN 数据,要求 Python 3.10、PyTorch 2.1.2 与 LLaVA OneVision 权重。训练分为地理空间理解预训练和带 DAgger 的空中导航微调;应同时固定动作网格、对话模拟器设置、问题预算和评估指标,才能公平比较主动交互策略。