Skip to content

REAL:可探索、可沟通且可部署的视觉移动操作智能体

Mi, B., Ma, M., Yao, Y. et al. Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation. arXiv:2607.13653v2, 2026. 论文代码

三个问题

1. 论文解决了什么问题?

真实家庭移动操作不能调用仿真器的全局物体清单、目标三维位姿或“找某类别物体”的 oracle API;用户的初始指令也常有歧义。现有具身基准往往绕过这两点,导致智能体在仿真中看似会规划,部署时却不会主动探索、无法区分相似物体,也不会在信息不足时发问。

2. 作者解决问题提出了什么方法?

作者提出 REAL(exploRatory, communicativE, And deployLable):以 RGB 和可实物获得的家具先验替换 oracle 感知接口,用多层探索工具发现并以视觉 ID 标记物体;再引入与探索历史同步的模拟用户,使智能体可对含糊指令发问。基于这一环境,Qwen3-VL-8B 先经 SFT 学习结构化工具调用与记忆,再以 GSPO 在线强化学习学习探索、纠错和主动澄清。

3. 对我有什么启发?

是否“可部署”取决于训练时给模型的接口能否在真机实现,而不是仿真画面是否足够逼真。高层智能体应显式区分结构先验、经视觉证实的对象与尚未获得的信息;在多个候选都合理时,把提问作为受预算约束、可获奖励的动作,而非失败后的附加补丁,能让沟通与探索共同缩小不确定性。

一句话总结

REAL 构建了没有 oracle 物体信息、支持视觉探索和多轮澄清的开放世界移动操作环境,并以 SFT 加在线 RL 训练高层 VLM 智能体。其在 REAL-Bench 的互动 SUL 任务上取得 56.9% 成功率,并零样本迁移至 ARX LIFT2 双臂移动机器人,在 60 个真机回合中达到 78.3% 端到端成功率(表 1、2)。

问题与动机

许多仿真环境允许智能体直接取得物体类别、全局列表或目标位置,或将“查找某物”封装为真机难以复现的工具;同时默认用户给出的命令明确无歧义。REAL 的问题设定更接近实际:智能体只知道场景中有哪些固定家具(如 table_2),不知道里面有什么物体、物体外观与位置,必须先观察;若看见两块面包或多个抽屉,也需要基于自身观察向用户询问偏好(第 1、3 节)。

方法:REAL 环境与训练管线

1. 无 oracle 的视觉工具链

任务开始时,策略拥有来自既有建图栈的长期三维占据图和家具语义/ID,这些被视为可实物获取的结构先验;但没有全局物体清单、物体位姿、仿真状态或目标位置。工具链依次支持:

  • nav_to:在家具节点间导航;
  • walk_around:环绕指定家具,从多视角扫描被遮挡物体;
  • show_object_by_category:在当前视野检测指定类别;
  • gaze_at:接近并居中一个选定目标;
  • pick/place/open/close/ask:以视觉 ID 作为操作对象,或向用户澄清。

检测到的二维分割掩码会反投影到临时三维探索图,并在 RGB/SoM(Set-of-Mark)图像中标出视觉 ID,供后续操作引用。这让策略使用“已看见的对象”而非仿真内部对象名(第 3.1 节)。

2. 视觉接地的模拟用户与紧凑记忆

模拟用户由 VLM 驱动,拥有任务 profile,并与智能体的动作、观测历史同步;它发出故意模糊的初始请求,只有在智能体探索后提出 ask 时才按共同上下文回答。策略在每步输入当前视觉/执行反馈、上一步动作、工具 schema 与一份紧凑长期记忆;输出推理轨迹、更新后的 History/任务阶段摘要和下一条 JSON 工具调用。它不无限拼接完整历史,从而控制长时程上下文成本(第 3.1、4.1 节)。

3. 数据生成、SFT 与在线 RL

系统从 GRScenes 的 7 个高保真场景、100 个可交互家具和逾 2,500 个、639 类物体实例生成“源家具 - 目标家具 - 物体”搬运任务,加入家具级和物体级干扰项。规则规划器在仿真中产生专家轨迹;LLM 再把协作任务改写为模糊指令并插入问答。Qwen3-VL-8B-Instruct 首先以行为克隆学习推理、摘要和工具调用(视觉编码器冻结),随后用 critic-free 的 Group Sequence Policy Optimization(GSPO)在线优化。世界图状态差分提供进展奖励,并加入时间、失败操作惩罚,以及最多 3 次的难度条件化提问预算(第 4 节)。

REAL-Bench 与实验结果

REAL-Bench 有 241 个任务,分为家具干扰搬取放置 FDP(72)、家具与物体双干扰 FODP(56)、开关家具 FDO(48)和带模拟用户循环的 SUL(65)。所有指标均为成功率,后者专测智能体是否会主动澄清(第 5.1 节)。

  • 工具接口对齐是前提:零样本 Qwen3-VL-8B 在 FDP/FODP/FDO/SUL 仅为 0.0%/0.0%/0.0%/1.5%;一轮 SFT 升至 45.8%/30.4%/35.4%/36.9%,说明通用 VLM 即使具备视觉能力也不自然懂得该具身工具接口(表 1)。
  • RL 改善探索与互动:从一轮 SFT 继续 RL 后,FODP 从 30.4% 升至 33.9%,SUL 从 36.9% 升至 56.9%;后者超过表中最强商业零样本教师 gemini-3-pro-preview 的 53.8%。两轮 SFT 虽将 FDP 提至 65.3%,却让 FODP 降至 28.6%,显示纯模仿会对专家轨迹过拟合(表 1)。
  • 剩余瓶颈:对最佳 SFT+RL 的 100 个评测回合分析,53 个失败中物体混淆 25 个、遗漏关键动作 17 个、丢失记忆 9 个,表明冻结视觉编码器限制了 RL 对细粒度视觉接地的改善(图 3)。
  • 真机迁移:同一高层 MCP 工具接口连接仿真与 ARX LIFT2 双臂移动机器人,低层开关、抓取、放置由微调的 π0.5 执行。60 个回合总体 SR 为 78.3%、SPL 63.1%、平均 11.6 步、平均 0.72 次提问,单回合 VLM 推理延迟均值 68.4 秒;600 次低层 VLA 原子操作中 85.3% 可执行(表 2)。

局限与批判性阅读

作者明确指出,当前任务聚焦跨家具搬运,尚未覆盖时间顺序子任务或“放在盘子左侧”这类空间关系目标;模拟用户的偏好被限制为场景中已有物体,不能像真实用户一样中途改变目标或给出隐含意图;家具也只是整体实体,没有抽屉、层板等部件级表示,限制精细探索和操作(第 6 节)。此外,真机总体成功率虽高,但互动 SUL 仅 55%,且一次任务平均约 68 秒 VLM 推理,表明开放式视觉接地与实时性仍是部署瓶颈。该论文的 RL 优势主要在既定工具与场景分布内得到验证,动态人类、开放任务变化和更复杂运动失败的恢复仍需进一步评测。

与现有 VLN 笔记的关系

REAL 属于开放世界移动操作,而非按路线到达目标的传统 VLN;它把导航、视觉搜索、沟通和双臂操作放在同一高层工具调用循环中。它与 ELBA、To Ask or Not to Ask 都强调“何时询问”,但 REAL 的问题是用户意图与视觉实例消歧;与 NaVILA、DreamWaQ++ 的关系则是分层互补:REAL 负责高层探索与任务状态,后者类型的低层策略负责安全、连续的身体执行。

术语与关键证据

  • oracle perceptual API:可直接读取仿真全局真值的接口,如物体列表、类别查找或 3D 位姿;REAL 不将它们暴露给策略。
  • SoM(Set-of-Mark):在图像中标注可指代视觉对象的 ID,使语言模型能以编号选择具体实例。
  • GSPO:对整段生成序列计算、并按序列裁剪优化的组策略优化方法,适合奖励位于整段工具调用轨迹末端的 VLM 强化学习。
  • World Graph(WG):记录家具与其中物体实例的状态表示;只用于环境状态、任务生成和奖励计算,不直接暴露给策略。