Path-Etiquette:以 VLM 选择路径的机器人社会导航
Fang, Z., Xiao, A., Hsu, D., & Lee, G. H. From Obstacles to Etiquette: Robot Social Navigation with VLM-Informed Path Selection. arXiv:2602.09002v1, 2026. 论文|项目页
三个问题
1. 论文解决了什么问题?
无碰撞不等于合乎社交礼仪:机器人虽可从人群间穿过,却可能挡住拍照视线、插入队伍、穿过交谈者或靠近梯子上的工人。既有社会导航多以距离、避碰或显式群组为依据,难以理解活动、关系和隐含规范;直接频繁调用大 VLM 又难以实时运行。论文要让机器人在动态场景中同时兼顾几何安全、到达效率与对人类活动的低打扰。
2. 作者解决问题提出了什么方法?
作者提出层级的“生成—选择”框架。感知模块以 RGB+LiDAR 检测、跟踪人并估计运动;预测融合代价地图把 2.4 秒、20 条人类轨迹样本与实时障碍合并。规划器以 A* 和 Poisson-disk 采样的锚点生成 3–6 条差异化无碰撞候选路径;将路径投影到图像后,由微调的 Qwen-2.5-7B 根据场景活动与社会规范挑选路径。该模型从 GPT-4o 蒸馏社会推理:以 SCAND 生成 4,851 个训练、574 个验证图像—选择样本,量化后在线推理;低层改进 ORCA 仍负责反应式避人。
3. 对我有什么启发?
把大模型直接用于连续控制并非唯一选择。可先用可验证的传统规划保证候选动作安全、多样,再把 VLM 限定为小规模、可解释的排序/选择器;这样语义模型只回答它擅长的“哪条更得体”。此外,社会规范应围绕具体的“干扰”来定义和评测,而不应只以人与机器人间距代替。
一句话总结
Path-Etiquette 先在预测的人群运动与障碍约束下提出多条可行路径,再由经 GPT-4o 教师信号微调的小型 VLM 按场景社会规范选路,在 Spot 机器人四类实景试验中以零社会区域侵入和最低或接近最低的干扰指标完成导航。
问题与动机
人类活动产生的可通行空间不一定“社会可通行”:拍照者与被拍者之间的视线、交谈者间的空隙、队列前方或梯子附近都不能仅靠几何占据或近距离惩罚来表达。作者将目标表述为几何代价与社会代价的联合最优化,并作出关键假设:在覆盖充分的几何优路径集中,存在语义上最合宜的路径。因此,系统不显式手工枚举社会规则,而是用视觉语言模型从候选路径和场景上下文中判断(第 III 节)。
方法:预测约束生成,VLM 语境选路
1. 人体运动与未来代价地图
YOLOv10 在 RGB 图像检测人,ByteTrack 保留最近 40 帧轨迹;LiDAR 点投影到图像并在检测框内聚类,从而估计三维位置。动态人以轨迹和速度描述,刚出现、无历史的目标作为伪静态人。预测器在 2.4 秒窗口输出 20 条人类未来轨迹;系统按从 0.8 到 0.1 的时间衰减累积这些位置、平滑后与实时 LiDAR 障碍叠加,因而候选路径预先考虑可能的人群移动(第 IV-A、B 节)。
2. 多样候选路径与社会合规选择
普通 A 只偏好最短路,可能没有绕行或让行方案。作者在起点—目标方向的矩形区域均匀采样锚点,对每个锚点分别 A 到锚点和目标,再以 Hausdorff 距离聚类,保留 3–6 条候选。VLM 看到叠加候选路径的图像后,输出路径描述、所选编号和理由;其决策为高层参考,规划器持续重规划并检索相近路径,避免 VLM 延迟直接影响控制。改造的 ORCA 以所选路径路标生成速度,并在合适的迎面关系中让机器人承担更多避让责任(第 IV-C–E 节)。
3. 从大 VLM 蒸馏到实时模型
GPT-4o 在训练数据上按受约束提示给候选路径作社会规范判断;作者用这些图像—选择对全参数微调 Qwen-2.5-7B。SCAND 中以未来 6 秒轨迹估计粗目标、在 ±10° 扰动并采样 13–14.5 m 的目标,以即时点云障碍图规划候选;去除无人帧并降至 1 Hz 后得到 4,851/574 个训练/验证样本。推理时,4-bit 量化 Qwen 经 vLLM 部署在 H100 服务端,降低相比 GPT-4o 的时延(第 IV-D 节)。
实验与结果
作者在配备 RGB、LiDAR 与 Jetson Orin 的 Boston Dynamics Spot 上测试四种受控情景:绕开擦玻璃梯子、避免穿过交谈的两人、避开摄影视线、不要插队。每种情景 3 次试验,对比 G-MPC、AttnGraph-RL、ViNT、VLM-Social-Nav 与 GSON;指标包括导航时间(NT)、个人空间侵犯时长(PSV)、面对行人时长(TFP)、社会区域干扰时长(SIT)及最大区域侵入比(Max. SIR)(第 V 节)。
- 社会合规性:所提方法在擦玻璃、交谈、拍照三场景的 PSV 和 SIT 都为 0、Max. SIR 都为 0;排队场景为 PSV 0.33 s、SIT 0、Max. SIR 0。表 I 中其他方法会在至少部分场景侵犯社会区域、靠得太近或无法在 90 s 内到达。
- 效率与安全的平衡:四场景平均导航时间分别为 28.48、28.49、40.15、26.14 s;这些路径并非始终最短,但均到达目标。相比之下,逐步动作评分的 VLM-Social-Nav 会在交谈和排队场景被卡住或阻塞行人,群组识别的 GSON 则难处理动态交谈与梯子安全等非显式群组情境。
- 消融:将可视路径缩短到约 1.2 m 时,其左右/直行选择与 VLM-Social-Nav 基本一致,说明长期路径选择而非单步方向是差异所在。把运动预测范围从 2.4 s 缩至 0 时,10 个标注场景中的组区域相交候选比例由 8.89% 增至 39.17%,表明预测先清理候选集能减轻 VLM 的负担(表 II)。
局限与批判性阅读
论文明确指出 VLM 只看当前帧而没有记忆,难理解相机外延伸的长队;多个同时发生或意图模糊的活动会令社会规则优先级混乱;若规划和聚类时已滤掉最佳路径,VLM 也无从修复。实验仅含四类设计情景、每种 3 次,且 Qwen 在 H100 服务端运行,尚不足以量化开放环境、长时记忆、网络时延或在同等算力下的泛化能力。社会区域的定义也依赖人为设定,因此“最低干扰”仍应结合更大规模的被试感受研究验证。
与现有 VLN 笔记的关系
OmniVLA、NaVILA 与 Uni-NaVid 侧重由多模态输入直接预测或生成行动;Path-Etiquette 保留经典几何规划与反应控制,只让 VLM 在少量可行轨迹中做社会语义选择。它也与视觉对话导航中的“信息不足时主动问询”形成互补:当单帧看不清排队起点、活动关系或规范时,可将不确定性传给对话/记忆模块,而不是强迫路径选择器猜测。
术语与关键证据
- 社会区域(social zone):由活动关系界定的不可打扰区域,如交谈两人之间、摄影视线或队列空间;论文以 SIT 与 Max. SIR 单独计量。
- 预测融合代价地图(prediction-fused costmap):将预测轨迹的时间信息投到二维栅格,使 A* 生成阶段已规避未来可能的拥堵与阻挡。
- 生成—选择(propose–select):规划器负责产生安全、多样的候选,VLM 负责基于常识和上下文排序,ORCA 负责即时速度避障。