Skip to content

OpenFly:空中视觉语言导航综合平台

Gao, Y. et al. OpenFly: A Comprehensive Platform for Aerial Vision-Language Navigation. ICLR 2026. OpenReviewarXiv

一句话总结

OpenFly 将空中视觉语言导航(Aerial VLN)的瓶颈从“训练一个导航器”扩展到“如何规模化生产真实、多样且可用的数据”:论文统一四类渲染环境,自动生成轨迹和语言指令,得到 10 万条样本;同时提出只保留关键信息帧的 OpenFly-Agent,以较低的历史视觉开销完成端到端动作预测。

为什么需要 OpenFly

无人机 VLN 要在开放三维空间中把自然语言和第一视角视觉对应起来。已有数据集通常规模较小、场景来源单一、人工采集与标注成本高,因而难以覆盖高度变化、长路径、不同城市风貌和真实世界外观。论文的核心目标是提供可复用的数据基础设施,而不是为固定模拟器单独设计策略。

平台与自动化工具链

OpenFly 接入 Unreal Engine、GTA V、Google Earth 与 3D Gaussian Splatting(3D GS) 四类渲染来源。3D GS 让无人机实拍场景可重建为可交互的 real-to-sim 环境,补足纯游戏引擎的域差异。

数据生成分为四步:

  1. 点云获取:对 UE/GTA V 采用栅格采样并拼接局部点云;对 3D GS 使用 COLMAP 稀疏重建。
  2. 语义分割:从点云中提取建筑、桥梁、塔等地标;可结合 Octree-Graph、二维投影轮廓与 GPT-4o 描述,质量不足时允许人工修正。
  3. 轨迹生成:在全局体素地图中随机选取地标和起终点,使用 A* 与定制动作空间规划无碰撞路径;串联子路径以产生更复杂路线。
  4. 指令生成:按转向、升降等关键动作将轨迹切段,把关键图像与动作交给 GPT-4o 生成子指令,再由语言模型合成为完整导航指令。这样避免将整段冗余视频直接输入 VLM。

数据集

最终数据集包含 18 个场景、10 万条轨迹、15.6K 词表,覆盖不同高度与长度,并同时包含合成城市、地理影像和重建校园等视觉域。相比 AerialVLN 等依赖人工飞手/众包指令的基准,OpenFly 的价值在于:新场景可沿相同管线继续扩充。需要注意,指令由模型自动生成,论文抽样人工检查的合格率为 91%;因此使用时仍应关注模糊地标、错误指代和生成分布偏差。

OpenFly-Agent:关键帧感知导航

连续飞行视频相邻帧高度重复,逐帧保留会浪费计算,也会稀释与指令相关的地标。OpenFly-Agent 以语言、当前观察和历史关键帧为输入,直接输出离散飞行动作,包含两项设计:

  • 关键帧选择(KS):先从运动明显变化的时刻产生候选帧;再通过指令地标的视觉定位结果筛选,只有地标足够显著的观察才写入记忆。
  • 视觉 token 合并(VTM):合并相邻关键帧中相似的视觉 token,保留显著内容、压缩背景冗余。论文使用容量为 2 的小型记忆库,并以 Llama2-7B 为决策骨干。

这是一种“以地标相关性决定记忆”的设计,而不是机械地按时间间隔采样,对长程导航尤其合理。

实验结论

测试集以导航误差(NE,低更好)、成功率(SR)、Oracle 成功率(OSR)和路径效率(SPL)评估。OpenFly-Agent 在 test-seen / test-unseen 的 SR 为 34.3% / 22.6%,高于最强对比 NaVila 的 20.3% / 14.7%;对应 SPL 为 24.9% / 19.1%。也就是说,相对于该对比中最强基线,绝对 SR 分别提高 14.07.9 个百分点。

消融的核心结论是:关键帧筛选和 token 合并同时带来效果与效率收益;仅靠增大历史帧数量并不能解决长程导航,关键在于保存何时、何处出现了与语言相关的视觉证据。

启发与局限

  • 启发:空中 VLN 的可扩展性依赖数据引擎、场景多样性与模型记忆机制三者协同;自动指令生成能放大数据,但应保留人工抽检与可追溯的中间标注。
  • 局限:轨迹由地图与 A* 规划,可能与真实飞手的探索/避障行为不同;模型仍以离散动作和离线评估为主,尚未充分覆盖真实传感器噪声、动态障碍、控制延迟和飞行安全约束。
  • 研究方向:可进一步研究真实闭环飞行、指令质量自动评测、跨引擎/跨城市泛化,以及以全局语义地图补充短记忆库。