Skip to content

3D-IC:以三维交互链联合规划移动操作

Zhang, K. et al. Joint Navigation and Manipulation Planning with 3D Interaction Chains. ICML 2026 (PMLR 306). 论文代码

三个问题

1. 论文解决了什么问题?

论文面向开放词汇移动操作(OVMM):机器人要在未知室内环境中根据指令找到物体、抓取它、找到目标容器并放置。已有系统通常将导航和操作拆成独立阶段,这会出现“虽然走到了物体附近,但该停靠姿态被遮挡、无法抓取”或“局部可放置但整条路径很绕”的问题。

2. 作者提出了什么方法?

3D-IC 将 RGB-D 观测构造成共享的三维特征地图,在物体、容器和探索前沿周围生成与四个任务阶段对齐的候选交互航点,再把它们串成候选链。微调后的 Qwen2.5-VL-7B 用航点邻域的三维特征估计可行性,规划器同时权衡任务进度、各航点可行性与转移距离,选出整条链中最优的下一个航点;底层则仍以专用导航和抓放策略执行。

3. 对我有什么启发?

当具身任务由异构技能组成时,统一的中层表示可以承担跨技能规划,而不必强行让一个端到端策略直接输出所有低层动作。关键不只是把地图做成 3D,更是将“下一步的位置是否便于后续交互”显式纳入长程目标函数。

一句话总结

3D-IC 将找物、抓取、找容器、放置统一为一条由三维交互航点组成的链,并在执行中持续重规划。该方法以 VLM 判断每个候选航点的交互可行性、以距离约束路径代价,在 OVMM 基准上获得 52.7% 的平均阶段成功率和 21.9% 的最终放置成功率,优于所比较的方法(论文第 9 页,表 5)。

研究问题与动机

OVMM 的四个顺序阶段是:对象导航(FindObj)、抓取(Pick)、容器导航(FindRec)和放置(Place)。导航通常依据累积地图输出离散底盘动作,而操作依据当前第一视角观测输出连续 6-DoF 末端位姿;这使既有模块化和 RL 方法往往分别决策两类技能(第 3 页)。

这种分解遗漏了跨阶段依赖:例如,最短的到物体路径未必通向无遮挡且机械臂可达的抓取姿态;一个近处容器表面也未必稳定可放。本文的目标是在保持专用低层控制器的同时,为四阶段选择全局上更可执行、更高效的计划。

方法

共享三维特征地图

机器人将 RGB 图像经 ViT 编码为 patch 特征,以 Grounding DINO 和 Mobile SAM 取得开放词汇语义标签,再结合深度、内参和相机位姿投影到三维。每个三维点保存位置、语义特征、类别与置信度;同一位置的多次观测保留置信度更高者。置信度随像素偏离相机光轴而降低。地图还投影出地面、障碍和“已知地面与未知区域边界”的前沿,后者在目标尚未被看到时用作探索候选(第 4–5 页)。

从航点到交互链

每个航点为 (x, y, z, yaw) 加一个动作 token:movegraspplace

  • s1(找物):若发现物体,在其周围环形采样面向物体的底盘停靠点;否则使用前沿点。
  • s2(抓取):在物体表面、接近质心高度处采样抓取候选位。
  • s3(找容器):在目标容器周边采样停靠点;未发现时使用前沿点。
  • s4(放置):从容器可用高度内最大的支撑面采样放置点。

链内阶段编号必须严格递增;若机器人已抓住物体,候选链只能连接容器导航与放置航点。故一条链不仅定义当前应去哪里,也预先比较后续抓取和放置的可能性(第 5 页)。

联合评分与执行

规划器最大化“最终阶段进度 + 平均航点可行性 - 距离代价”。距离代价是相邻航点的欧氏距离;为控制 VLM 开销,先按进度与距离预排序,只保留前 6 条链进行 VLM 推理(第 5–7 页)。

对一个航点,系统从其朝向的后方发射视线束,在三维特征地图中采集每条视线的最近可见表面特征;这些局部特征作为视觉 token 输入 VLM,由它估计抓取、放置或导航阶段是否可行。选定链后仅执行第一个航点,再随新观测重建地图、候选集和链;move 交给 FMM 等局部导航器,grasp/place 交给 CuRobo、AnyGrasp 等操作模块(第 4–6 页)。

VLM 训练

作者在 12 万条指令跟随样本上微调 Qwen2.5-VL-7B,其中包括 3 万条 token 解释、3 万条航点偏好比较和 6 万条轨迹选择样本。训练按“理解单航点三维 token → 比较同阶段候选 → 选择多阶段链”的课程进行;候选链在仿真执行,碰撞、接触、位置误差等反馈再由标注 VLM 归因并经人工修订(第 6 页)。

实验与结果

设置与指标

实验采用 OVMM 标准设置,使用最终 Place 阶段成功率作为整任务成功率,并新增/强调 SPL(成功加权归一化路径长度)衡量效率。作者指出该基准原有的平均步数会把“尽早放弃”的失败轨迹也算得较短,可能造成效率偏差(第 6 页)。三维地图体素分辨率为 0.05 m,特征聚合视点后移 0.5 m、水平视场角为 90°(第 7 页)。

仿真主结果

相较于表 5 中最强的总体成功率基线 MoTo(49.6%),3D-IC 的平均阶段成功率为 52.7%;FindObj、Pick、FindRec、Place 的 SR 分别为 69.1%、64.0%、55.6%、21.9%,且四阶段 SPL 分别为 26.7、26.5、13.2、4.9。其平均步数为 844.1,也低于文中列出的其他方法(第 9 页,表 5)。

消融实验支持三项设计:

  • 三维地图特征表示的平均 SR 为 52.7%,高于点云几何特征(39.1%)、点云特征加标签(40.2%)和 RGB 点云渲染(42.2%)(第 7 页,表 1)。
  • 只做逐阶段独立航点决策时平均 SR 为 49.7%;将四阶段全部连成链后升至 52.7%,最终放置 SR 从 15.8% 升至 21.9%(第 8 页,表 2)。
  • 三种微调任务同时使用时达到 52.7% 平均 SR;只使用轨迹选择时为 49.8%,表明 token 理解与候选比较能补强最终轨迹选择(第 8 页,表 3)。

真机结果

作者在 Hello Robot Stretch 3、客厅/餐区/两间卧室组成的家庭环境中评测 35 次:25 个同房间任务、10 个跨房间任务。3D-IC 相比启发式基线,平均 SR 从同房间的 33.0% 提升至 44.0%,跨房间从 25.0% 提升至 40.0%;跨房间 Place 成功率从 0% 提升到 20%(第 8 页,表 4)。

贡献与局限

主要贡献

  1. 以同时保留地图级上下文和第一视角语义的三维特征地图,连接导航与操作的异构输入。
  2. 以跨四阶段的交互链替代逐阶段贪心决策,将后续可操作性纳入当前位置选择。
  3. 用基于三维 token 的 VLM 可行性评分和分层执行策略,在仿真及 Stretch 3 真机上报告了成功率与路径效率提升。

局限与适用范围

论文没有单列局限章节;以下是由设定与结果直接引出的限制。

  • 系统依赖高质量 RGB-D、相机位姿、开放词汇检测/分割和三维投影;任一环节的语义或几何误差都会影响候选航点与链评分。
  • 交互链评分中的路程是航点间欧氏距离,并非完整的碰撞约束路径代价;作者仍以局部导航器保证实际执行(第 5 页)。
  • VLM 仅评估预排序后的 6 条链,效率与搜索覆盖率之间存在取舍;最优链可能在预筛阶段被排除。
  • 真机测试总计 35 次,跨房间仅 10 次,论文未报告置信区间、失败类别的统计分布或不同家庭/不同机器人上的泛化结果,因此真机增益的稳定性仍需更大规模验证。
  • 最终 Place SR 虽为比较中最高,仍只有 21.9%,说明长程移动操作中的抓放可靠性仍是主要瓶颈。

批判性阅读

消融结果较有力地表明共享三维表示、链式联合规划和三阶段微调都对基准成绩有贡献,尤其是完整链对 Place 阶段的提升。但“全局最优”应理解为在作者构造的候选集合、启发式预排序和评分函数内的最优,而不是对真实连续动作空间的严格全局最优。

值得进一步追问的是:

  • 若目标物被遮挡、深度噪声较大或相机位姿漂移,三维 token 与 VLM 可行性评分会怎样退化?
  • 与直接使用真实可行性标签、或不使用 VLM 的学习型评分器相比,VLM 推理本身带来了多少独立收益、多少延迟?
  • 能否将欧氏距离替换为考虑障碍、底盘运动学、手臂可达性和不确定性的路径代价,并在更大候选集上近似搜索?
  • 真实部署中的失败主要来自感知、导航、抓取、放置还是链选择?这会决定后续优化的优先级。

可复用启发

  • 对 VLN 或移动操作系统,可将“目标附近”改为一组带朝向的交互航点,并在高层规划时提前检查下一技能的可行性。
  • 三维地图不必只存类别;将视觉主干的特征与空间位置绑定,可让同一表征服务检索、几何约束和 VLM 推理。
  • 评价长程具身任务时应同时报告成功率和成功条件下的路径效率;仅看平均步数容易掩盖过早终止。
  • 课程式决策监督可以从表示解释、候选排序逐步过渡到整条轨迹选择,降低让 VLM 直接学习复杂规划的难度。

术语与关键证据

  • OVMM(Open-Vocabulary Mobile Manipulation):在未知环境中按自然语言指令,完成找物、抓取、找目标容器和放置的移动操作任务。
  • 交互航点(interaction waypoint):带三维位置、底盘朝向与动作类型的高层目标;它表示“应从何处进行移动/抓取/放置”。
  • 交互链(3D Interaction Chain):跨后续任务阶段连接多个交互航点的候选计划。
  • SPL:Success weighted by normalized inverse Path Length;同时惩罚失败与成功但路径冗长的轨迹。
  • 关键证据:完整四阶段链的平均 SR 为 52.7%,优于独立阶段决策的 49.7%(第 8 页,表 2);仿真总体 Place SR 为 21.9%,真机跨房间 Place SR 为 20.0%(第 8–9 页,表 4–5)。