[论文解读] Environment Predictive Coding for Embodied Agents
本文提出环境预测编码(EPC),一种自监督方法,通过训练智能体基于相机位姿条件预测第一人称视频序列中被遮蔽的视觉内容,从而学习3D环境级别的表征。EPC在Gibson和Matterport3D上的导航任务中优于当前最先进方法,仅需有限经验即可实现更高的样本效率和鲁棒性。
We introduce environment predictive coding, a self-supervised approach to learn environment-level representations for embodied agents. In contrast to prior work on self-supervised learning for images, we aim to jointly encode a series of images gathered by an agent as it moves about in 3D environments. We learn these representations via a zone prediction task, where we intelligently mask out portions of an agent's trajectory and predict them from the unmasked portions, conditioned on the agent's camera poses. By learning such representations on a collection of videos, we demonstrate successful transfer to multiple downstream navigation-oriented tasks. Our experiments on the photorealistic 3D environments of Gibson and Matterport3D show that our method outperforms the state-of-the-art on challenging tasks with only a limited budget of experience.
研究动机与目标
- 为具身智能体在视觉导航任务中解决缺乏可泛化、高层级3D环境表征的问题。
- 通过从非结构化的第一人称视频数据中学习环境级别表征,提升导航任务中的样本效率与可迁移性。
- 使智能体能够利用从视频漫游中学习到的几何与语义先验,推理3D环境中未见区域的视觉内容。
- 开发一种不依赖任务特定监督或手工编码地图的自监督方法。
提出的方法
- 该方法将第一人称视频序列分割为视觉和几何上连通的区域,重叠部分有限。
- 在轨迹中随机遮蔽部分区域,并训练基于Transformer的模型,利用未遮蔽区域和相机位姿预测被遮蔽的视图。
- 通过解决区域预测任务,使模型学习环境级别表征,其中预测同时依赖视觉特征与3D相机位姿信息。
- 自监督预训练在Gibson和Matterport3D等3D环境的大规模漫游视频上进行。
- 生成的环境嵌入被微调或迁移至下游导航任务,如区域覆盖、物体导航和基于目标点的导航。
- 该方法显式地将预测建立在3D空间关系之上,从而与标准视频预测或上下文预测任务区分开来。
实验结果
研究问题
- RQ1自监督学习环境级别表征是否能提升具身智能体导航的样本效率?
- RQ2在仅使用位姿和未遮蔽视图的情况下,基于视频漫游训练的模型能否推断3D环境中缺失的视觉内容?
- RQ3与图像级别表征学习和端到端训练相比,EPC在下游性能和鲁棒性方面表现如何?
- RQ4EPC在传感器噪声和次优视频采集策略下具备多大程度的鲁棒性?
主要发现
- 在Gibson-S上,EPC实现31.5 m²的区域覆盖,在Gibson-L上实现64.0 m²,分别优于SMT (Video)的2.8 m²和19.3 m²(在1300万帧时)。
- 在Matterport3D上,EPC实现176.3 m²的区域覆盖和13.8次物体覆盖,显著优于SMT (Video)的126.2 m²和10.0次物体覆盖。
- 即使视频数据通过简单启发式方法采集,或注入深度与位姿噪声,EPC仍保持强劲性能,表明其对数据质量变化具有鲁棒性。
- 当深度和位姿传感器受损时,EPC在传感器噪声下表现出更强的鲁棒性,优于所有基线方法(包括OccupancyMemory)。
- 即使在考虑来自离策略视频漫游的额外经验后,EPC仍保持性能优势,表明其具备真正的样本效率。
- 在MP3D-cat上,EPC实现9.0次物体覆盖,在MP3D-inst上实现36.4次物体覆盖,两项指标均显著优于次佳方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。