HUMEMBR:学习人类日常规律的预测性具身导航
Huber, S., Pelzer, K., Nguyen, D. M., Xiao, X., & Pirk, S. HUMEMBR: Learning Human Routines for Predictive Embodied Navigation. arXiv:2606.30404v1, 2026. 论文|项目页与代码
三个问题
1. 论文解决了什么问题?
长期部署的机器人不应只知道静态地图,还应能回答“某人通常几点到办公室”“此时更可能在哪里”,并据此去寻找或服务该人。既有具身记忆多存储孤立、对象中心的观察,或把全部历史直接交给 LLM;前者无法跨天追踪身份和习惯,后者在冗长上下文中易被无关信息稀释且成本高。HUMEMBR 要从连续观测中构建身份感知的人类日常规律记忆,用于问答和预测性导航。
2. 作者解决问题提出了什么方法?
系统并行运行“记忆构建”和“查询”两条流程。构建端筛去相似画面,以图像、GraphNav 路标、时间戳、视觉描述与人物身份写入记忆;人脸特征先在线 DBSCAN 聚类为高置信身份锚点,再用全身 ReID 为侧脸/遮挡观测补关联。查询端让 LLM 调用语义观测、路标历史、人物历史、每日出现人员、按人日汇总五类检索函数,并可下发导航到路标的动作。检索会同时考虑语义相关性和时间新近性,而不是读取完整日志。
3. 对我有什么启发?
面对长期具身任务,记忆的关键不是“存得更多”,而是先定义可被行动消费的结构:身份、时间、空间、证据与聚合层级。将高风险的身份关联与检索放在可审计模块中,再让 LLM 负责迭代假设和工具编排,比让模型在所有原始记录中自由回忆更有效;同时必须把缺席、遮挡、身份误配和隐私同等作为系统设计问题。
一句话总结
HUMEMBR 用跨天人物身份聚类、带时间衰减的层级检索与 LLM 函数调用,让 Spot 机器人按人类规律回答问题并预测性搜人;在 PersonEQA 上,Gemini 3 Flash 版本以 83% 更少 token 将总准确率从全上下文基线的 67.33% 提升到 75.41%,并完成两个真实环境中的导航任务。
问题与动机
办公室和家庭随人的作息而改变:同一人会在特定时段出现于偏好位置,也会因衣着、发型、视角和遮挡导致身份观测不一致。单帧语义地图不能表达这些跨天规律;完整日志虽包含证据,却使模型在大量相似路标与描述中难以定位相关线索。作者因此将人类规律视为一种长期、动态、身份绑定的空间时间记忆,并将语义问答和导航作为同一检索—推理闭环(第 I、III 节)。
方法:从持续观察到例行规律导航
1. 紧凑且身份感知的记忆构建
机器人以 2 Hz 采集 RGB;ResNet50 特征与上次保留帧的余弦相似度用于丢弃冗余画面。每条保留记录含图像、GraphNav 空间参考、时间戳,以及由 Qwen3-VL-235B 生成并用 mxbai-embed-large-v1 向量化的描述。YOLO 姿态检测器发现人物;可见脸由 InsightFace 提取特征、在线 DBSCAN 聚类,未见脸的观测以 KPR 全身 ReID 特征和阈值最近邻归入已有身份,从而结合稳定人脸锚点与对遮挡/姿态变化更稳健的全身线索(第 III-A 节)。
2. 多层函数检索与闭环执行
LLM 迭代调用五类函数:按查询相似度检索语义观测(默认 top-30,可按人和截止时间过滤)、按时间段取路标观察、按人取时间序列观察、查询某天出现的人员、以及对某人某日活动生成汇总。语义检索分数结合嵌入余弦距离与随时间衰减的惩罚;这让“最近在哪”与“通常在哪里”可用不同粒度的证据回答。若用户要求“寻找某人”,模型继续调用导航函数前往候选路标,并可在到达时核验该人是否存在(第 III-B 节、图 3)。
3. 数据与评测任务
作者用 Spot 在真实办公室 20 天、31 小时的运行中采集 Collaborative Office Behavior Dataset(COBD):13,000 余张图像、136 个路标,人物按自然作息活动而非按脚本演出。基于该数据构建的 PersonEQA 有 200 个问题,涵盖人物识别、二元、时间、时长、语义描述和空间六类;空间答案距真值路标 5 m 内算对,时间/时长允许 ±5 分钟(第 IV、V 节)。
实验与结果
- 检索优于全量上下文:使用 Gemini 3 Flash,HUMEMBR 总准确率为 75.41%(空间 92.31%、语义 81.48%),高于把查询前所有描述直接放入上下文的基线 67.33%(空间仅 34.62%、语义 75.00%),每题 token 从 631,651 降到 106,347,减少约 83%(表 I、图 10)。基线在人物识别和事件时间上略高,说明完整日志仍有利于精确查找,但会稀释空间线索。
- 开放模型与模块消融:Qwen3-VL-235B 的 HUMEMBR 为 66.01%,接近基线但仅用 11,589 token(约 2%);去除 ReID 降为 60.49%,只保留三种核心检索函数降为 63.04%,验证身份关联与高层汇总的价值。函数调用上限为 10 时表现最好或接近最好,更多调用并不稳定提升准确率(表 I、II)。
- 真实部署:作者在两个不同规模、布局与人流密度的环境中部署 Spot,每项任务重复 10 次。例行搜人“Find Dory”成功率 90%,接待访客和取回包裹均为 100%;部分遮挡下找人仅 50%,其首访检测率为 30%。失败多来自背视、椅子遮挡、逆光/低照度导致的人脸检测和 ReID 失效,或目标缺席时模型幻觉出历史观察(第 VII 节、表 IV)。
局限与批判性阅读
论文指出记忆目前主要来自相机流,未包含房间标签等额外空间/个人信息;未来可由直接处理近期图像的 VLM 补足仅依赖文字描述的细节损失。数据只来自一个办公室、20 天和有限参与者,例行规律能否迁移到不规则家庭、更多人员或季节性变化仍未明确。评测对全上下文基线只跑一个随机种子,而 HUMEMBR 平均三个种子,比较的统计可靠性较弱。更重要的是,持续记录身份和作息具有明显监控风险;作者仅在同意、可撤回与假名化条件下收集,并强调不可用于非自愿跟踪或高风险决策(第 VIII、IX 节)。
与现有 VDN 笔记的关系
CommNav 用一次问询从旁观者获取目标的即时位置线索;HUMEMBR 则从机器人自身跨天观察中学习目标的长期先验。两者可以互补:先以 HUMEMBR 预测某人最可能出现的区域,途中再以 CommNav 的问询校正近期变化。与 Path-Etiquette 相比,HUMEMBR 解决“去哪里找谁”的长期记忆问题,Path-Etiquette 则解决“到那里时如何不打扰人”的局部社会路径选择。
术语与关键证据
- PersonEQA:面向跨天人物行为与规律的具身问答基准,不只检索过去画面,还要求时间、地点和例行模式推理。
- 身份锚点(identity anchor):以较稳定的人脸嵌入形成高置信聚类,再用全身 ReID 扩展缺脸观测的双阶段关联策略。
- 上下文稀释(context dilution):完整日志虽然保留全部证据,但大量重复路标/时间 token 会降低 LLM 对空间线索的辨析度;表 I 的空间准确率对比直接展示了这一现象。