[论文解读] Instance-Specific Image Goal Navigation: Training Embodied Agents to Find Object Instances
本文提出了实例特定图像目标导航(InstanceImageNav),这是一种新型具身智能基准,要求智能体使用来自任意视角和相机参数的目标图像导航至特定物体实例,且与智能体传感器无关。该方法在HM3D环境中使用聚焦的、高覆盖率的物体实例图像,基于模型无关的强化学习基线仅取得5.5%的成功率,凸显了该任务的挑战性及未来研究的必要性。
We consider the problem of embodied visual navigation given an image-goal (ImageNav) where an agent is initialized in an unfamiliar environment and tasked with navigating to a location 'described' by an image. Unlike related navigation tasks, ImageNav does not have a standardized task definition which makes comparison across methods difficult. Further, existing formulations have two problematic properties; (1) image-goals are sampled from random locations which can lead to ambiguity (e.g., looking at walls), and (2) image-goals match the camera specification and embodiment of the agent; this rigidity is limiting when considering user-driven downstream applications. We present the Instance-specific ImageNav task (InstanceImageNav) to address these limitations. Specifically, the goal image is 'focused' on some particular object instance in the scene and is taken with camera parameters independent of the agent. We instantiate InstanceImageNav in the Habitat Simulator using scenes from the Habitat-Matterport3D dataset (HM3D) and release a standardized benchmark to measure community progress.
研究动机与目标
- 为解决现有ImageNav基准中缺乏标准化和真实感的问题,这些问题通常使用随机采样的、模糊的图像目标。
- 克服将图像目标与智能体传感器和具身性绑定的局限,从而提升其在真实世界中的适用性。
- 通过聚焦于自然、上下文丰富的视图中的特定物体实例来生成目标图像,提升任务清晰度和应用相关性。
- 建立一个标准化基准并提供公开排行榜,以实现对实例特定视觉导航的公平评估,并推动社区研究进展。
- 发布大规模的episode数据集,包含700万条训练episode和2,340条验证episode,用于训练和评估导航策略。
提出的方法
- 通过在物体实例周围径向采样相机视角生成目标图像,设置物体覆盖度和画面覆盖度的阈值,以确保图像清晰且自然。
- 在Habitat-Sim环境中基于HM3D场景(附带HM3DSEM语义分割标注)实现该任务。
- 通过拒绝采样法生成起始位置,以确保存在有限的测地线路径且导航路径非平凡,测地线距离与欧氏距离的最小比值为1.05。
- 使用PPO训练基于模型无关的强化学习基线,采用双流ResNet-18编码器处理RGB、深度图和目标图像特征,结合LSTM记忆模块和动作头。
- 将RGB、深度图、目标图像、GPS和朝向特征拼接后,通过两层LSTM进行处理,再进行动作预测。
- 该基准包含元数据,如最短路径长度、测地线距离以及有效视角,用于评估。
实验结果
研究问题
- RQ1将图像目标规范与智能体传感器和具身性解耦,能在多大程度上提升视觉导航在真实世界中的适用性?
- RQ2与随机采样的图像目标相比,聚焦于实例的特定目标图像在多大程度上减少了模糊性?
- RQ3当前端到端强化学习方法在真实、非结构化环境中进行实例特定图像目标导航的性能上限是什么?
- RQ4所提出的基准如何实现不同导航方法之间的公平且标准化的评估?
- RQ5在未见过的环境中,从实例特定图像目标训练的策略面临哪些关键泛化挑战?
主要发现
- 所提出的InstanceImageNav基准使用聚焦于特定物体实例的目标图像,与随机采样的图像目标相比,显著降低了模糊性。
- 目标图像使用与智能体传感器无关的相机参数捕获,提升了用户驱动应用的灵活性和真实性。
- 该基准在附带语义标注的Habitat-Sim环境和HM3D场景中实现,支持真实且多样的导航任务。
- 基于模型无关的强化学习基线在验证集上仅取得5.5%的成功率和2.3%的SPL,表明仍有巨大提升空间。
- 训练集包含7,032,000个episode,验证集包含2,340个episode,为评估和研究提供了大规模数据集。
- 在EvalAI上发布的公开排行榜有望实现评估标准化,并加速实例特定视觉导航领域的研究进展。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。