CityFly:以城市标识为导航锚点的低空无人机视觉语言导航
Jiang, Y., Yang, C., Li, J. et al. CityFly: Signmark-guided autonomous UAV navigation with vision language model. Pattern Recognition, 181 (2027), 114651. 论文
三个问题
1. 论文解决了什么问题?
论文关注贴近末端配送等应用的低空城市街道导航。相比俯视空中导航,街道级无人机容易受到楼宇遮挡、弱定位和复杂视角变化影响;常用的大型地标又稀少且外观相似。作者认为店铺招牌、交通与公共指示牌等 signmark(文字、符号、图形构成的可读语义标识)更密集、更稳定,应成为语言指令和飞行决策的核心锚点。
2. 作者解决问题提出了什么方法?
作者定义无地图、弱定位条件下的 signmark-guided VLN(SG-VLN)任务,构建 UE5+Cesium 香港三维城市与 3D Gaussian Splatting(3DGS)街景组成的数据生成平台,并提出基于 Qwen 系列视觉语言模型的导航智能体。智能体将口语指令改写为“看到某标识后执行某动作”的阶段步骤,融合最近多帧图像,并以可见的目标标识触发子轨迹状态转换。
3. 对我有什么启发?
对城市导航而言,真正有用的锚点不一定是最显眼的建筑,而可以是可验证、与动作绑定的文本语义。把长指令拆成“标识触发 - 阶段动作 - 下一个标识”的闭环,比仅保存转弯点的历史更适合街景连续观测;但锚点设计必须同时考虑可读性、遮挡、OCR 误识别和跨城市风格变化。
一句话总结
CityFly 将低空街景无人机导航转化为由招牌等城市标识逐阶段触发的 VLN 问题,并用口语改写、多帧融合与标识子轨迹记忆提升稳定性。在更接近真实成像的 3DGS 未见场景中,其 SR/SPL 达到 25.9%/19.4%,高于 OpenFly 的 11.2%/6.9%(表 5)。
问题与动机
传统 UAV-VLN 常用桥梁、道路等稀疏地标,或从鸟瞰视角建模;但低空街道中无人机需要在店铺立面、路口和遮挡物之间精确飞行,GPS 和地图也可能失效。标识具有文字和符号语义,能直接对应“在 KFC 招牌后右转”之类的人类指令,因此既可作为定位线索,也可作为执行下一阶段的可观察条件(第 1、3 节)。
方法:SG-VLN 与 CityFly Agent
1. 任务、动作与成功条件
智能体仅接收口语导航指令、当前 RGB 图像及历史图像,在线输出 停止、前进 3 m、左转 15°、右转 15° 四种离散动作。若停止时距目标店铺入口不超过 6 m,即记为成功;这一阈值严于 OpenFly 使用的 20 m 阈值(第 3 节)。
2. 平台、轨迹和指令生成
平台以 UE5、Cesium 与 AirSim 加载香港三维城市地图,并额外以实采全景图重建 3DGS 街景,检验跨成像域鲁棒性。轨迹生成先将飞行高度处的三维占据图切成二维可通行网格,在路口图上用 Dijkstra 规划全局路径,再用 A* 生成局部连续路径。系统从转弯、过街等关键事件选择对应标识,并组织为“起始 - 中间标识触发 - 终点停止”的口语指令(第 4 节)。
3. 三个导航模块
- 口语改写:提取前进、转弯、停止等动作,将指令规范为带触发和终止条件的“标识 - 动作”步骤。
- 多帧视觉融合:融合最近的多个 RGB 帧,缓解视点变化、遮挡和动态物体造成的单帧标识识别不稳。
- 细粒度子轨迹建模:把完整指令拆成多个子目标;当前目标标识在融合图像中可见时,阶段索引推进到下一子目标,否则维持当前动作策略,形成“标识 - 阶段动作 - 标识触发转换”的闭环(第 6 节)。
数据集与实验结果
SG-VLN 约含 2,100 对轨迹 - 指令:387 条短轨迹平均 130 m,1,710 条长轨迹平均 342 m、经过约 5-6 个路口。除香港三维地图的已见/未见划分外,作者以西北工业大学附近实采街景重建的 3DGS 场景作为完全未见的跨域测试。评估指标为导航误差(NE)、成功率(SR)、oracle 成功率(OSR)和路径加权成功率(SPL)(第 5、7.1 节)。
- 短轨迹:在未见场景,CityFly 的 NE/SR/OSR/SPL 为 56.4 m/26.4%/28.3%/17.5%,优于 OpenFly 的 73.8 m/5.8%/11.6%/2.9%(表 3)。
- 长轨迹:在未见场景,SR/SPL 为 13.8%/7.2%,仍显著高于 OpenFly 的 3.6%/1.4%,但也显示长程累计误差仍然明显(表 4)。
- 跨域 3DGS 场景:CityFly 的 NE/SR/OSR/SPL 为 37.9 m/25.9%/27.1%/19.4%,对比 OpenFly 为 58.7 m/11.2%/20.4%/6.9%(表 5)。
- 标识是否优于地标:仅用标识在跨域集取得 SR 25.9%、SPL 19.4%,均高于仅用地标的 23.7%、18.2%;地标与标识结合则进一步达到 26.6%、19.9%,说明稀疏标识路段仍可由地标补充(表 6)。
- 消融:短轨迹中,从单帧且无历史(SR 18.6%、SPL 13.0%)到多帧加标识子轨迹(28.3%、20.6%)均有提升;跨域集也从 17.0%/12.4% 升至 25.9%/19.4%,其中子轨迹记忆贡献尤为明显(表 7)。
局限与批判性阅读
作者明确指出,当前数据扩展仍主要依赖仿真采样,复杂街景会引入感知噪声,且真实无人机需要适应新的城市与陌生标识风格(第 8.2 节)。论文的 3DGS 测试比纯仿真更接近真实外观,但仍不是带风扰、动态交通、定位误差和飞控约束的真实闭环飞行;动作空间也只有三自由度的前进与偏航。数据可用性部分还说明当前 Hugging Face 托管的是初步测试数据,完整官方数据集将后续补充。因此,实验充分支持“显式标识锚点优于仅依赖地标”的基准内结论,但真实部署还需验证 OCR 失误、语言多样性、夜间天气和安全避障条件。
与现有 UAV-VLN 笔记的关系
CityNav 与 OpenFly 重在城市级数据和通用地标/关键帧导航;CityFly 把视角降低到街道立面,并把可读标识提升为一等导航状态。它与 PSC-AVDN 都以显式中间状态提高可解释性:后者用解析 - 搜索 - 确认和空间记忆解决高空对话定位,前者用标识触发的子轨迹解决低空连续飞行。
术语与关键证据
- Signmark:文字、符号和图形融合的可读环境标识,如店铺、交通或公共指示牌;不同于仅描述颜色形状的大型地标。
- SG-VLN:Signmark-guided Vision-Language Navigation,利用标识作为指令触发与决策锚点的低空街景导航任务。
- 3DGS:3D Gaussian Splatting,以高斯基元表示场景的三维重建/渲染方法;本文用于构造与训练城市地图不同的街景测试域。
- OSR:轨迹中任意时刻进入 6 m 成功半径的比例,可区分“曾经到达附近”与“最终正确停止”。