[论文解读] SOAT: A Scene- and Object-Aware Transformer for Vision-and-Language Navigation
该论文提出SOAT,一种面向视觉-语言导航的场景与物体感知Transformer模型,通过为场景分类和物体检测分别使用独立的视觉编码器,并利用选择性注意力机制整合两者,以提升语言指令的定位能力。该方法在R2R数据集上实现SPL提升1.8%,在RxR数据集上实现SR提升3.7%,在物体密集型指令上更是达到最高7.9%的SR增益,证明了结合物体级别特征的视觉-语言预训练在提升导航性能方面的有效性。
Natural language instructions for visual navigation often use scene descriptions (e.g., "bedroom") and object references (e.g., "green chairs") to provide a breadcrumb trail to a goal location. This work presents a transformer-based vision-and-language navigation (VLN) agent that uses two different visual encoders -- a scene classification network and an object detector -- which produce features that match these two distinct types of visual cues. In our method, scene features contribute high-level contextual information that supports object-level processing. With this design, our model is able to use vision-and-language pretraining (i.e., learning the alignment between images and text from large-scale web data) to substantially improve performance on the Room-to-Room (R2R) and Room-Across-Room (RxR) benchmarks. Specifically, our approach leads to improvements of 1.8% absolute in SPL on R2R and 3.7% absolute in SR on RxR. Our analysis reveals even larger gains for navigation instructions that contain six or more object references, which further suggests that our approach is better able to use object features and align them to references in the instructions.
研究动机与目标
- 通过在指令中显式建模场景级与物体级视觉线索,提升视觉-语言导航(VLN)性能。
- 通过使用与预训练数据对齐的物体检测特征,缓解视觉-语言预训练与VLN微调之间的领域差异。
- 设计一种Transformer架构,选择性地利用场景特征作为上下文线索,同时将计算重点集中于物体级表征。
- 评估视觉-语言预训练是否能有效利用物体特征进行VLN,尤其是在复杂且物体丰富的指令中。
- 证明物体级定位显著提升在RxR等挑战性基准上的导航性能,尤其在包含大量物体引用的指令中。
提出的方法
- 模型采用两种独立的视觉编码器:基于Places的CNN用于场景分类,Faster R-CNN用于物体检测,生成互补的视觉特征。
- 场景特征用作高层上下文线索,而物体特征通过一种改进的Transformer处理,其选择性注意力机制冻结了场景表征。
- 注意力机制经过重构,使物体特征能够关注场景特征以获取上下文,但反之不成立,从而确保场景特征保持固定并作为上下文使用。
- 模型通过视觉-语言预训练(如VLN-BERT)进行端到端微调,利用大规模网络数据对齐图像与文本表征。
- 采用视图聚合策略,在每个导航步骤中选择最相关的视觉特征用于动作预测。
- 在R2R和RxR基准上评估该方法,并通过消融实验隔离物体特征与预训练的影响。
实验结果
研究问题
- RQ1显式建模场景与物体视觉线索是否能提升视觉-语言导航性能?
- RQ2使用与视觉-语言预训练对齐的物体检测特征,是否能提升导航指令中指代表达的定位效果?
- RQ3与标准注意力机制相比,对场景和物体特征区别处理的选择性注意力机制如何影响性能?
- RQ4视觉-语言预训练在多大程度上使物体级特征在VLN中得到有效利用?
- RQ5该模型是否在物体引用密度较高的指令中表现出更大增益,表明物体定位能力得到提升?
主要发现
- 与VLN-BERT基线相比,SOAT在R2R验证集未见数据集上实现了1.8%的SPL绝对提升。
- 在更具挑战性的RxR基准上,SOAT将成功率(SR)提升3.7个百分点,NDTW提升2.4分。
- 在包含六个或更多物体引用的指令中,SOAT相比VLN-BERT基线实现了7.91%的SR绝对提升。
- 若无视觉-语言预训练,物体特征带来的性能增益可忽略不计,表明预训练对有效利用物体级表征至关重要。
- 在英语指令下,该模型在RxR上的表现优于当前最先进方法,尤其在物体密集型导航场景中。
- 消融实验确认,选择性注意力机制至关重要——若仅简单添加物体特征而无架构调整,性能反而下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。