Skip to main content
QUICK REVIEW

[论文解读] Self-supervised 3D Semantic Representation Learning for Vision-and-Language Navigation

Sinan Tan, Mengmeng Ge|arXiv (Cornell University)|Jan 26, 2022
Multimodal Machine Learning Applications被引用 6
一句话总结

该论文提出了一种用于视觉-语言导航的自监督3D语义表征学习框架,通过区域查询掩蔽任务从RGB-D输入中学习体素级3D语义特征。该方法在R2R验证集未见分割上达到68%的成功率,在测试集未见分割上达到66%,优于大多数基于RGB的方法,证明了3D语义特征相较于仅RGB特征的优越性。

ABSTRACT

In the Vision-and-Language Navigation task, the embodied agent follows linguistic instructions and navigates to a specific goal. It is important in many practical scenarios and has attracted extensive attention from both computer vision and robotics communities. However, most existing works only use RGB images but neglect the 3D semantic information of the scene. To this end, we develop a novel self-supervised training framework to encode the voxel-level 3D semantic reconstruction into a 3D semantic representation. Specifically, a region query task is designed as the pretext task, which predicts the presence or absence of objects of a particular class in a specific 3D region. Then, we construct an LSTM-based navigation model and train it with the proposed 3D semantic representations and BERT language features on vision-language pairs. Experiments show that the proposed approach achieves success rates of 68% and 66% on the validation unseen and test unseen splits of the R2R dataset respectively, which are superior to most of RGB-based methods utilizing vision-language transformers.

研究动机与目标

  • 为解决仅使用RGB特征在视觉-语言导航中引入纹理噪声并易发生过拟合的局限性。
  • 利用RGB-D观测中的3D语义信息,提升具身智能体的感知能力和导航泛化性能。
  • 开发一种无需密集3D标注的自监督预训练方法,用于3D语义表征。
  • 在基于LSTM的导航模型中融合语言特征与3D语义特征,以提升性能。
  • 证明3D语义特征比RGB特征更有效,并且在融合时具有互补优势。

提出的方法

  • 设计了一项区域查询掩蔽任务,用于预测特定物体类别在3D体素区域中是否存在,从而实现3D语义表征的自监督学习。
  • 通过投影和体素化,从全景RGB和深度观测中生成3D语义重建。
  • 使用未标注的3D重建数据,在区域查询任务上预训练3D语义编码器,学习编码局部语义内容。
  • 使用BERT提取语言特征,导航策略则采用LSTM结合交叉注意力机制,融合语言与3D语义特征。
  • 最终的导航模型通过两阶段训练流程在R2R数据集上微调:首先在带说话者增强的数据上训练,然后在原始R2R训练集上继续微调。
  • 通过模仿3D语义编码器的输出,对RGB分支进行特征初始化,提升了特征对齐性与性能。

实验结果

研究问题

  • RQ1与仅使用RGB的方法相比,自监督3D语义表征学习是否能提升视觉-语言导航性能?
  • RQ2在未见环境中,引入3D语义特征是否能减少过拟合并提升泛化能力?
  • RQ3在无密集3D标注的情况下,区域查询掩蔽任务能否有效预训练3D语义编码器?
  • RQ4在导航成功率和鲁棒性方面,3D语义特征与RGB特征相比表现如何?
  • RQ5在多模态框架中,融合3D语义特征与初始化后的RGB特征是否具有互补优势?

主要发现

  • 所提方法在R2R验证集未见分割上达到68%的成功率,在测试集未见分割上达到66%,优于大多数使用视觉-语言Transformer的基于RGB的方法。
  • 仅使用3D语义特征时,在验证集未见分割上达到66.8%的成功率,显著优于使用标准RGB特征时的58.1%成功率。
  • 通过使用3D语义编码器输出对RGB分支进行初始化,性能提升至63.3%,表明3D特征可有效引导RGB特征学习。
  • 将3D语义特征与初始化后的RGB特征(RGB*)融合后,成功率达到67.7%,超过任一单独组件,表明存在互补优势。
  • 消融实验证实,3D语义特征比RGB特征更有效,且区域查询掩蔽任务可实现有效的自监督预训练。
  • 两阶段训练流程——先在带说话者增强的数据上训练,再在R2R上微调——使成功率提升至66.8%,证明了数据增强与微调的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。