ELBA:通过主动提问学习具身视觉导航与任务完成
1. 基本信息
- 标题:ELBA: Learning by Asking for Embodied Visual Navigation and Task Completion
- 作者与机构:Ying Shen、Daniel Biś、Cynthia Lu、Ismini Lourentzou(UIUC、Amazon)
- 发表年份、会议:WACV 2025,pp. 5177-5186,DOI: 10.1109/WACV61041.2025.00506
- 链接:论文 · 代码
- 研究领域与关键词:具身智能、主动提问、视觉对话、任务完成、TEACh
三个问题
1. 论文解决了什么问题?
论文解决具身导航与家居任务代理只能被动执行指令、面对对象或子目标歧义时不知道何时提问以及应该问什么的问题。
2. 作者解决问题提出了什么方法?
ELBA 用 ACTIONER 的动作/对象熵或梯度衡量困惑度,以 PLANNER 预测未来子目标,由 QA GENERATOR 产生模板式和自由式候选问答,再由对比学习的 QA EVALUATOR 选择能降低困惑度的内容。
3. 对我有什么启发?
主动提问策略应同时优化任务收益、沟通成本和回答风险;可以采用“生成候选信息—评估状态相关性—验证是否降低不确定性”的通用流程,并在真实噪声、延迟和拒答条件下检验其稳健性。
2. 一句话总结
ELBA 让具身代理不只执行指令,还能在不确定时自主决定何时提问、问什么。它以动作与对象预测的不确定性触发问答,从模板式和自由式候选问答中筛选有用信息,在 TEACh 家居任务中优于不具备问答能力的 E.T. 基线。
3. 研究问题与动机
现有具身导航与任务完成模型多为被动跟随指令,难以处理“该用什么容器”“目标物在哪里”等执行中自然出现的歧义。已有辅助导航研究又常使用固定模板或已知、唯一的 oracle 答案;复杂物体交互的下一步并不总有唯一解。本文的目标是学习面向任务的自由式问答闭环(第 1、3 节)。
4. 方法
- ACTIONER + 困惑度模块:ACTIONER 预测下一动作和交互对象;当动作熵/对象熵超过阈值,或梯度范数较大时,认为代理困惑并尝试提问。只有加入所选问答后困惑度下降,才真正发问(第 4.1 节)。
- PLANNER:基于历史话语与可用动作,使用微调 T5 预测未来高层子目标,为“下一步该做什么”的答案提供候选(第 4.2 节)。
- QA GENERATOR / EVALUATOR:生成位置、外观、方向、当前/下一子目标等模板问答,以及由子目标答案驱动的自由式问答;再用对比学习训练的 DistilBERT,将当前状态与候选问答匹配、排序并采样(第 4.3-4.4 节)。
5. 实验与结果
作者在 AI2-THOR 上的 TEACh EDH seen/unseen 测试集评估任务成功率(SR)、目标条件成功率(GC)及路径长度加权版本(第 5.1 节)。相较 E.T.,熵式 ELBA 在 seen 上将 GC 从 15.7% 提升到 19.2%,在 unseen 上将 SR/GC 从 4.9%/3.3% 提升至 5.7%/3.8%;梯度式版本也有提升(表 2)。
消融显示,模板问答、自由式问答及二者组合均可超过基线;后两种在多数 unseen 指标上更优(表 3)。按困惑度提问平均为每任务 44±64 次,而每三步固定提问需 102±101 次,减少约 57% 的提问,但固定频率在部分 seen 设置下表现更高(图 3)。
6. 贡献与局限
- 将动态“何时问”和“问什么”纳入视觉对话导航与物体交互;同时支持模板与自由式问答。
- 以不确定性下降作为提问采纳条件,强调信息效率而非一味增加问答。
- 作者展示了错误颜色判断、语法不良问答和时机失当导致来回询问等失败案例(图 6)。方法还依赖模拟环境可构造的候选答案与训练好的问答模块;论文未验证真实人类回答具有噪声、延迟或拒答时的表现。
7. 批判性阅读
实验足以说明在 TEACh 的 oracle 式信息条件下,提问能提升平均指标;但“问答能降低困惑度”并不必然等价于“问答真实且有用”。固定间隔提问在一项设置中更好,也说明熵阈值并非稳健的最优时机策略。未来应报告提问预算下的成功率、真实回答质量扰动,以及从候选生成到执行的端到端失败归因。
8. 可复用启发
对于交互式机器人或无人机,提问策略应同时优化任务增益、沟通成本和等待风险。ELBA 的“先生成候选信息、再用状态相关性与不确定性过滤”可迁移为:由地图/检索/VLM生成候选澄清问题,再在安全约束和人机负担预算下选择是否询问。
9. 术语与关键证据
- Embodied Learning-By-Asking:代理在执行过程中主动请求额外任务信息的学习范式。
- EDH:TEACh 的 Execution from Dialogue History 评测设置,依据对话历史执行家居任务。
- GC / SR:已完成目标条件的比例 / 完成全部目标条件的回合比例(第 5.1 节)。