To Ask or Not to Ask:检测 VLN 中的信息缺失
Abraham, S. S., Garg, S., & Dayoub, F. To Ask or Not to Ask? Detecting Absence of Information in Vision and Language Navigation. WACV 2025, pp. 7480-7489. 论文|arXiv
三个问题
1. 论文解决了什么问题?
论文研究 VLN 智能体何时应停止猜测并请求澄清,目标是在漏问导致走偏与频繁提问打扰用户之间取得平衡。
2. 作者解决问题提出了什么方法?
作者提出 Instruction Vagueness 模块,把已执行路径和预测下一步与指令做注意力对齐,检测该动作是否得到语言支持;模型用路径派生的伪标签训练,并与熵、动作置信度及保形预测等触发方式比较。
3. 对我有什么启发?
“是否提问”可以从语言—行动一致性而非单纯模型置信度判断;实际系统还应把触发器、问题生成、回答利用和交互预算联合优化,并分别报告精确率、召回率与导航收益。
一句话总结
这篇论文研究 VLN 智能体在什么时候应该停下来寻求澄清,而不是继续猜测。作者提出指令模糊度(Instruction Vagueness, IV)模块:它不尝试判断“缺了哪条信息”,而是从指令与智能体已走/计划走的路径是否对齐,判断当前下一步动作是否因指令不充分而不可靠。该对齐监督使精确率—召回率平衡提升约 52%。
问题:不问与乱问同样糟糕
多数 VLN 基准默认指令足够完整,智能体必须独立行动。但真实用户的表达可能简略、抽象或组织混乱;例如只说“去厨房附近”,未说明从当前房间应走哪条支路。若智能体过于自信,会走偏并浪费动作;若每一步都请求帮助,又会给用户带来不必要的交互负担。
因此,论文把任务定义为检测信息缺失导致的行动不确定性,核心权衡为:
- 过度谨慎:能发现更多模糊时刻(高召回),但频繁打扰用户;
- 过度自信:只在极少数情况下提问(高精确率),但容易错过真正需要帮助的时机。
目标是以较平衡的方式触发“ask”,而不是提高普通导航器在完整指令下的 SPL。
方法:Instruction Vagueness(IV)模块
导航器在时刻 t 给出最可能的下一节点。IV 模块将该候选节点追加到已执行路径,形成“截至下一步的预期路径”,再与编码后的指令做多头注意力对齐。对齐特征进入二分类器,输出 certain 或 uncertain:
instruction + executed path + predicted next move
↓
instruction-to-path attention
↓
certain / uncertain
直觉是:如果路径的下一步无法被指令中相应片段支持,指令—路径注意力应暴露这种不匹配;这比仅看导航器对候选动作的置信度更接近“语言本身是否足够”。当输出 uncertain 时,系统请求外部帮助,而不是执行原动作。
训练与对比
作者利用路径监督构造不确定性伪标签,并额外训练指令—路径对齐网络来提供更直接的模糊度信号。论文对比三类常见替代方案:
- 导航器不确定性:结合视觉—指令注意力与下一步概率;
- 熵阈值:候选动作分布接近均匀就视为不确定;
- 保形预测:按最大动作概率和校准阈值拒绝低置信动作。
这些方法主要检测模型是否犹豫;IV 模块则额外检测“模型要走的路是否被当前文字支持”。
实验设置与结果
作者将 R2R 风格的详细指令压缩为更粗粒度的 I_short,模拟真实的模糊说明。使用短指令时,原导航器明显退化:例如 DUET 的 SPL 从 54.46 降至 47.35,NE 从 3.86 m 升至 5.30 m;HAMT 的 SPL 从 43.82 降至 31.58。
模糊度检测用下式衡量精确率—召回率平衡:
[ \text{Balance} = \frac{\text{Precision} - \text{Recall}}{\text{Precision} + \text{Recall}} ]
值为 0 表示二者平衡,负值偏向频繁提问,正值偏向少提问。与只依赖导航器注意力、熵或保形预测相比,加入指令—路径对齐监督的 IV 模块将平衡性改善约 52%。在 IV 判为不确定时由 oracle 给出引导,SPL/NE 的改善表明它能更及时地避免走偏;这项改善用于验证“提问时机”,并非声称在无外部帮助下刷新导航 SOTA。
价值与局限
- 价值:将“知道自己不知道”从泛化不确定性转化为可操作的语言—路径一致性检测,是主动澄清导航的重要前置能力。
- 价值:模块可叠加在既有导航器上,不要求重新设计其动作策略。
- 局限:论文只判断何时问,不生成“该问什么”;实际系统还需要问题生成、用户回答解析与状态更新。
- 局限:训练依赖从路径派生的伪标签,且带有不同表达风格的人工标注路径成本较高;模糊指令的构造方式也可能影响结论。
- 局限:oracle 辅助高估了真实用户响应的可靠性和及时性;真实部署需同时评估提问预算、问题质量与用户体验。
与对话式 VLN 的关系
AVDN 和 AerialVLA 假设或学习多轮对话中的导航;本文提供其中更基础的门控问题:在什么状态下值得进入一次澄清交互。两者可以组合为“IV 负责触发,生成模型负责提问并利用回答继续导航”的闭环。