CityNav:真实世界空中导航的大规模数据集
Lee, J. et al. CityNav: A Large-Scale Dataset for Real-World Aerial Navigation. ICCV 2025, pp. 5912-5922. 论文|代码与数据
一句话总结
CityNav 是面向真实城市的空中视觉语言导航(VLN)数据集:在剑桥与伯明翰的真实三维城市点云中,收集人类演示轨迹和目标描述,并提出地理语义地图(GSM)作为全局辅助模态。论文表明,在城市尺度上,仅凭第一视角视觉难以可靠理解地标关系;将语言中提到的地标放入二维地图能显著改善导航。
背景与任务
既有空中 VLN 多建立在合成场景中,真实城市则有更大的区域、更密集且外观相似的建筑、复杂道路网络和难以从局部视角判断的空间关系。CityNav 定义的是语言目标导航:智能体从空中第一视角出发,根据描述定位并飞向目标,例如“位于某道路、某学院建筑旁的建筑”。
重点不是逐字复现一条预设路线,而是理解“目标—参照地标—相对位置”的关系,并在连续三维环境中找到目标。
数据集与采集
CityNav 使用真实城市的三维点云表示,覆盖英国 Cambridge 与 Birmingham 共 4.65 km²。作者通过网页端 3D 模拟器招募人类完成导航,得到 32,637 条人类演示轨迹及其自然语言描述,是论文发表时规模最大的真实世界空中 VLN 数据集。
使用人类轨迹而非只用最短路很重要:人会为了确认地标而绕行、升高或靠近显著物体。论文与代码实验均指出,用人类演示训练的模型优于用几何最短路径训练的模型,这说明“高效最短路”并不等于“符合人类语言、易于视觉确认的路线”。
方法:地理语义地图(GSM)
关键动机
第一视角图像只覆盖局部,长程导航中可能看不见指令所说的参照物。CityNav 因此将城市点云与语义地标组织为二维全局地图,并将其作为 RGB、深度和文本之外的辅助输入。
表示与使用方式
GSM 在地图上编码道路、建筑等可识别地标及其位置关系;从文本中抽取相关地标后,模型即可在地图中对齐“在 A 旁边”“位于 B 路上”等语言线索。论文将 GSM 接入 Seq2Seq、跨模态注意力(CMA)和 AerialVLN 三类基线,证明该地图表示具有模型无关的可迁移性。
可以将其理解为给反应式视觉导航器增加“可查询的城市草图”:视觉负责局部确认和避障,地图负责全局定位、地标消歧和航向选择。
实验结论
论文以导航误差(NE,低更好)、成功率(SR)、Oracle 成功率(OSR)与成功路径效率(SPL)评估。主要发现如下:
- 人类演示训练优于最短路径训练,说明地标导向的行动分布更适合语言导航。
- 加入 GSM 后,Seq2Seq、CMA 和 AerialVLN 均获得稳定提升,特别是在长程、未见环境中;全局地理先验能减少仅靠局部图像导致的迷失。
- 即使有地图,模型与人类仍存在明显差距,真实城市尺度的地标识别、空间推理与长程规划仍是瓶颈。
- 论文还模拟洪涝灾害来测试鲁棒性:环境变化会显著影响只依赖视觉的导航,地图语义先验能提供一定帮助,但不能替代对动态可通行性的感知。
与 AerialVLN / OpenFly 的关系
| 基准 | 场景来源 | 核心难点 | 主要贡献 |
|---|---|---|---|
| AerialVLN | 合成城市 | 长路径、连续 3D 动作 | 早期城市级 UAV VLN 基准与 LAG |
| OpenFly | 多引擎与 3D GS | 数据规模和视觉域多样性 | 自动化 10 万轨迹数据生产平台 |
| CityNav | 真实城市点云 | 地标关系、真实城市泛化 | 人类演示与地理语义地图 |
局限与启发
- 覆盖范围仅限两座城市;扩大到更多城市仍受高质量三维扫描成本限制。
- 点云模拟器和离散导航并不等同于真实飞行,尚需验证传感器噪声、动态交通、禁飞区和安全控制。
- GSM 的价值说明:城市级导航应把全局地理知识与局部第一视角证据结合,而非只增加模型历史长度。
- 后续可探索多无人机协作、空中—地面—室内统一导航,以及随环境变化更新的动态语义/可通行性地图。
可复现提示
官方实现需要下载 CityNav 数据与 SensatUrban 点云,再栅格化为模型输入。复现实验应明确使用的人类/最短路径训练数据、飞行高度、是否启用 GSM 及其地标分割设置,并优先报告未见区域和灾害扰动下的结果。