DreamWaQ++:具备韧性多模态强化学习的障碍感知四足运动控制
Nahrendra, I. M. A., Yu, B., Oh, M. et al. DreamWaQ++: Obstacle-Aware Quadrupedal Locomotion With Resilient Multimodal Reinforcement Learning. IEEE Transactions on Robotics, 42 (2026), pp. 819-833. 论文
三个问题
1. 论文解决了什么问题?
四足机器人只靠本体感觉(关节、IMU 等)虽然稳健,却往往要先碰到台阶或障碍才能调整步态;加入相机或 LiDAR 外感知又会受低频、延迟、噪声和外参误差影响。论文要解决的是:如何在不依赖精确地图、且外部传感器可能不可靠的情况下,让单一策略仍能实时、无碰撞地跨越台阶、沟壑、斜坡和软性地形。
2. 作者解决问题提出了什么方法?
DreamWaQ++ 使用分层多模态编码器:将最近多次深度/激光点云经位姿对齐形成外感知记忆,以带置信过滤的 PointNet 提取地形特征;再以 MLP-Mixer 编码时序本体感觉,并将两类潜变量在多模态 Mixer 中融合。系统通过 PPO、速度估计与 VAE 重建、特权高度图对比学习、以及鼓励技能多样性的互信息奖励联合训练。
3. 对我有什么启发?
具身导航的“记忆”应服务于传感器不同频与不同可靠度,而不是盲目堆叠历史帧。更实用的做法是:先把异步观察对齐,再显式过滤不可信模态,并在训练中允许一种模态失效;此外,以技能多样性约束防止策略只学到保守步态,也能迁移到视觉语言系统中的局部恢复与安全执行层。
一句话总结
DreamWaQ++ 是一套面向四足机器人的感知运动控制器,不是直接处理语言指令的 VLN 模型;其价值在于提供了可与 VLN 高层规划衔接的低层避障与地形适应能力。它通过时空点云记忆、本体 - 外感知潜变量融合与技能发现训练,在 Go1 上实现了无需真机微调的台阶、斜坡和异常传感条件下的敏捷运动。
问题与动机
传统模型式控制依赖准确状态估计、地形图和足端轨迹优化,计算与建模假设较重。深度强化学习的盲走策略可减轻 sim-to-real 差距,却不能提前感知障碍;直接把外感知输入策略又面临控制环约 50 Hz、外传感器约 10 Hz 的异步问题。DreamWaQ++ 的核心判断是:外感知应负责预见前方地形,本体感觉应在观测冲突或失效时兜底,两者必须通过有记忆的融合机制协调(第 I、III 节)。
方法:韧性多模态强化学习
1. 外感知记忆与置信过滤
系统把当前与过去 K=5 次点云通过 SE(3) 变换对齐到当前机体坐标,得到更稠密的局部点云记忆;变换由 IMU 朝向和本体编码器估计的线速度更新,且每收到新外感知时重置积分以限制漂移。外感知编码器采用 PointNet,并以点特征方差构造置信掩码,抑制高方差的离群/噪声点后再 max-pooling。外感知以 10 Hz 采样,兼容深度相机和 3D LiDAR(第 3.2-3.3 节)。
2. 本体编码与潜变量融合
本体编码器将过去 H=5 个本体观测作为时序输入,用 MLP-Mixer 同时建模传感器维度和时间维度,并以 VAE 产生随机潜变量、预测机体线速度及下一时刻观测。归一化后的本体与外感知潜变量再经多模态 Mixer 融合,作为 actor 的上下文;critic 在仿真训练时额外使用真值高度图等特权信息。策略 50 Hz 输出目标关节位置,由 200 Hz PD 控制器跟踪(第 3.4-3.5 节)。
3. 训练目标与韧性来源
除 PPO 任务奖励外,作者加入:
- 估计与 VAE 重建损失:学习速度估计、未来本体观测和机器人局部高度图,同时用自适应
β平衡重建精度与解耦潜表示。 - 对比损失:使 actor 从不完整观测得到的多模态潜变量接近 critic 的特权高度图表示,而远离随机负样本;避免要求策略直接回归不可观测的完整环境状态。
- versatility gain:最大化潜变量与访问状态的互信息,推动策略探索多样步态,而非只收敛到平地上的保守动作。
训练还随机化动力学、观测延迟、传感器外参和多档噪声,以让策略学习把模态不一致视为可恢复的不确定性(第 3.6-3.7、4 节)。
实验与结果
作者在 Isaac Gym 中以 3,500 个并行环境训练约 11 小时,然后不作真机微调部署到 Unitree Go1;还测试了深度相机、Ouster LiDAR、双 Livox LiDAR 等配置(第 4、5 节)。
- 真实台阶竞速:DreamWaQ++ 控制的 Go1 在 50 级台阶上用 35 秒完成约 30.03 m 水平距离、7.38 m 爬升;同期盲走 DreamWaQ 约为 20.05 m/5.44 m,Unitree 内置感知控制器因绊倒未完成(第 5.2 节)。
- 异常与分布外地形:论文展示了未在训练中出现的软沙发、可移动平台、35° 坡和相机脱落情形。相机输入白噪声或完全脱落时,机器人会转向接触探测、降低风险姿态而不是立即失稳;35° 坡上其后腿力矩约为 DreamWaQ 的 1/1.5(第 5.5、6.5 节)。
- 跨平台与大障碍:仅调整机器人相关参数后,Go1、ANYmal-C 和 Hound 均可训练;Hound 在训练台阶最高 27 cm 的条件下,对 42 cm 台阶仍报告 80% 成功率。真机 Go1 携带 2.5 kg 载荷通过 41 cm 的软障碍(第 5.6-5.7 节)。
- 消融结论:在 10 cm、20 cm 连续台阶及 5-25 cm 离散障碍上,完整方法在成功率、行进距离和小腿碰撞数上均优于无记忆、LSTM 隐式记忆、仅拼接潜变量、去对比损失和去 versatility gain 的变体。无融合最损害稳定性;无显式记忆导致最多小腿碰撞;去除技能多样性收益的退化尤为明显(表 IV)。
局限与批判性阅读
论文证明了在多种真机演示中有很强的 sim-to-real 韧性,但控制任务仍主要在仿真奖励和预设地形分布中学习。点云记忆依赖线速度估计和短时 SE(3) 对齐,快速滑移或 IMU 严重失准时仍可能累积错误;“相机脱落后保持稳定”也不等于能够安全完成原始导航目标。versatility gain 提升探索,但潜变量并无语义可解释性,且关键维度会随随机种子改变(第 6.3 节)。此外,本文不涉及语言理解、全局路径或动态人群预测;在 VLN 系统中更合适的定位是高层 VLA/VLN 的局部运动与故障恢复模块,而非替代高层规划。
与现有 VLN 笔记的关系
NaVILA 同样将高层语言导航与低层腿式控制解耦:前者的低层策略负责执行“前进多少、向哪转”等中层动作,DreamWaQ++ 则更深入处理低层面对障碍、异步传感与外感知故障时如何维持安全运动。二者可互补:NaVILA 提供任务语义接口,DreamWaQ++ 的多模态记忆、置信过滤和技能发现提供鲁棒的地形执行先验。
术语与关键证据
- 本体感觉(proprioception):IMU、关节位置/速度等机器人自身状态观测。
- 外感知(exteroception):来自深度相机或 LiDAR 的环境点云;本文以 10 Hz 采样,低于控制与本体传感频率。
- 特权学习(privileged learning):训练中的 critic 可访问仿真真值高度图等部署时不可得信息,actor 只能使用真实可得的噪声观测。
- versatility gain:通过最大化潜变量与到访状态的互信息,促使强化学习策略形成更多可用的运动技能。