OctMem-Agent:面向开放世界空中目标导航的记忆增强场景理解与探索
Zhou, J. et al. Memory-Augmented Scene Understanding and Exploration for Open-World Aerial Object-Goal Navigation. CVPR 2026, pp. 21616-21626. 论文
三个问题
1. 论文解决了什么问题?
论文研究空中目标导航(Aerial ObjectNav):无人机仅根据 RGB-D 观察和“带绿色条纹的圆形水果”这类高层目标描述,在大尺度户外环境中寻找目标,而没有逐步路线指令。现有方法只看当前帧或短历史,缺乏可扩展的长期三维记忆和探索策略,因而容易重复搜索或在目标不在当前视野时迷失。
2. 作者解决问题提出了什么方法?
作者提出 OctMem-Agent。它将历史 RGB-D 观测增量写入自适应八叉树记忆:近处保留细粒度体素,远处使用粗粒度体素以压缩大范围空间;随后由语言经 FiLM 调制两类 Q-Former 查询,场景查询从近处记忆定位目标,探索查询从远处记忆寻找已探索与未探索区域的前沿。两类 token 与当前图像、目标文本共同输入 OpenVLA 风格的动作模型。
3. 对我有什么启发?
开放空间的目标导航不能只把更多历史帧塞入模型,而应同时存储“已经看过什么”和“哪些区域尚未探索”。记忆应随距离和任务需求改变分辨率;同时把目标定位与前沿探索显式拆分,能让提问、规划或飞行决策都有更清晰的职责边界。
一句话总结
OctMem-Agent 用自适应八叉树把历史 RGB-D 观测压缩为可扩展的分层三维记忆,并用目标描述引导两类查询分别完成近处目标定位与远处前沿探索。在 UAV-ON 基准上,它以 19.50% 总 SR 超过 OpenFly 的 12.00%,说明长期空间记忆对开放世界空中目标搜索比短视频历史更有效。
问题与动机
与“按路线走”的 VLN 不同,Aerial ObjectNav 只给出目标物体的高层描述,要求无人机在大尺度户外场景中自行搜索。AOA、OpenFly 等方法主要依赖局部观察或最近几帧历史,难以保存全局场景,也无法判断下一步应继续确认附近目标还是转向未探索区域。
直接使用稠密体素图同样不可行:其内存会随环境尺度快速增长;室内导航常用的稀疏图结构又难以处理户外场景的尺度差异和高度变化。论文的核心假设是:以距离自适应的层次三维记忆,配合任务相关的检索机制,可以在局部精度与全局覆盖之间取得平衡(第 1、3 节)。
方法:OctMem-Agent
1. 自适应八叉树记忆
每个时刻先将 RGB-D 图像的二维视觉 patch 投影为带几何位置的三维 patch,再按距离进行层次聚合:近处使用细体素保留目标细节,远处使用粗体素表示大尺度布局。聚合结果逐步写入全局八叉树,既索引已观测区域,也保留未探索区域的空间边界。实验将 50 m 设为近远分界,近/远区域步长分别为 5/25 m(第 3.2、4.1 节)。
2. 指令引导的记忆查询
模型先将目标文本编码为语言向量,并通过 FiLM 调制可学习查询;Q-Former 再从八叉树取回紧凑 token:
- Scene tokens 只关注近处体素,用于发现或精确定位与描述匹配的目标。
- Exploration tokens 只关注远处体素,用于识别探索区与未知区之间的前沿,在目标尚不可见时提供搜索方向。
这种分工把“看清目标”和“决定去哪里找”显式区分,避免单一注意力同时承担局部识别与全局探索(第 3.3 节)。
3. 动作生成
论文在 OpenVLA 上适配离散空中动作预测:DINOv2 与 SigLIP 视觉特征、当前 RGB、语言指令和两类记忆 token 融合后输入 LLaMA-2 7B,输出前进、左右转和停止等动作(第 3.4、4.1 节)。
实验与结果
UAV-ON 包含 14 个 Unreal Engine 户外环境、1,270 个目标物体;训练集有 10,000 个回合,测试集有 1,000 个回合,覆盖已见环境和 4 个未见环境。作者以 SR、OSR 和 SPL 评估,成功阈值为距目标 20 m 内(第 4.1 节)。
- 总体表现:OctMem-Agent 达到 SR 19.50%、OSR 29.30%、SPL 6.37%,较最强训练式基线 OpenFly 的 SR 12.00% 高 7.50 个百分点,也略高于 NaVid 的 11.50%(表 1)。
- 泛化:已见环境 SR/OSR/SPL 为 22.72%/30.48%/8.40%,未见环境仍保持 17.57%/28.59%/5.15%,均优于报告的对比方法(表 2)。
- 消融:无记忆与查询时 SR 为 12.40%;只加八叉树记忆升至 15.70%;再加指令引导查询达到 19.50%,验证记忆表示和任务化检索的互补作用(表 3)。去除 FiLM 指令调制后 SR 从 19.50% 降至 18.60%,说明检索需要与目标语义绑定(表 5)。
局限与批判性阅读
论文明确指出,八叉树依赖深度、位姿与 IMU 的准确性;弱光、恶劣天气、无纹理区域或姿态漂移会导致错误三维记忆(第 5 节)。此外,UAV-ON 是 Unreal Engine 仿真基准,训练轨迹由 3D A* 从标注生成;真实飞行中的风扰、动态障碍、感知延迟和探索行为分布仍未得到验证。
实验有力支持“在 UAV-ON 中,层次记忆和指令化查询优于短历史”的结论,但总 SR 仍不足 20%。因此更准确的解读是该方法显著改善了开放世界搜索基线,而不是已经解决了可靠的真实世界自主目标导航。未来需将不确定性传播、在线地图校正和安全约束纳入记忆更新与探索决策。
与现有 UAV-VLN 笔记的关系
OpenFly 主要解决数据规模与关键帧历史压缩,CityNav 以全局地理语义地图提供城市先验;OctMem-Agent 则面向无逐步路线的 ObjectNav,在飞行中从 RGB-D 自主构建任务相关的分层三维记忆。三者共同说明:空中导航的关键不只是 VLM 动作预测,而是如何用合适的空间记忆把局部观察转化为全局搜索能力。
术语与关键证据
- Aerial ObjectNav:仅凭目标描述和视觉观察寻找物体的空中导航任务,不提供逐步路线。
- Adaptive Octree Memory:按空间占据递归划分、并依据距离调整粒度的三维记忆结构。
- OSR:轨迹中任意时刻曾进入成功阈值的比例;它与 SR 一起区分“曾找到目标附近”与“最终正确停止”。