Paper-Reading
Paper Reading
VLN
- NaVid:基于视频的 VLM 为视觉语言导航规划下一步
- Uni-NaVid:统一具身导航的视频视觉语言行动模型
- Vision-and-Dialog Navigation:协作式视觉对话导航
- DialNav:与远程向导进行多轮对话导航
- To Ask or Not to Ask:检测 VLN 中的信息缺失
- NaVILA:用于导航的腿式机器人视觉语言行动模型
- DreamWaQ++:具备韧性多模态强化学习的障碍感知四足运动控制
- ULVN:仅用无序 RGB 图像的地标视觉导航
- REAL:可探索、可沟通且可部署的视觉移动操作智能体
- OmniVLA:统一语言、位姿与目标图像的全模态导航 VLA
- Path-Etiquette:以 VLM 选择路径的机器人社会导航
VDN
Embodied
UAV-VLN
- AerialVLN:面向无人机的视觉语言导航
- OpenFly:空中视觉语言导航综合平台
- OctMem-Agent:面向开放世界空中目标导航的记忆增强场景理解与探索
- PSC-AVDN:通过解析、搜索与确认实现免训练空中视觉对话导航
- AerialVLA:具备在线对话的空中视觉语言行动模型
- CityNav:真实世界空中导航的大规模数据集
- CityFly:以城市标识为导航锚点的低空无人机视觉语言导航
- OpenUAV:面向真实无人机视觉语言导航的平台、基准与方法
- LookasideVLN:方向感知的空中视觉语言导航