[论文解读] EnvEdit: Environment Editing for Vision-and-Language Navigation
本文提出EnvEdit,一种通过编辑视觉-语言导航(VLN)中的风格、物体外观和物体类别来生成多样化合成环境的数据增强方法。利用风格迁移和图像生成技术,EnvEdit创建出语义一致但视觉上截然不同的环境,使智能体能够更好地泛化到未见过的场景,在R2R和RxR基准上实现最先进性能,成功率达到绝对提升1.6%。
In Vision-and-Language Navigation (VLN), an agent needs to navigate through the environment based on natural language instructions. Due to limited available data for agent training and finite diversity in navigation environments, it is challenging for the agent to generalize to new, unseen environments. To address this problem, we propose EnvEdit, a data augmentation method that creates new environments by editing existing environments, which are used to train a more generalizable agent. Our augmented environments can differ from the seen environments in three diverse aspects: style, object appearance, and object classes. Training on these edit-augmented environments prevents the agent from overfitting to existing environments and helps generalize better to new, unseen environments. Empirically, on both the Room-to-Room and the multi-lingual Room-Across-Room datasets, we show that our proposed EnvEdit method gets significant improvements in all metrics on both pre-trained and non-pre-trained VLN agents, and achieves the new state-of-the-art on the test leaderboard. We further ensemble the VLN agents augmented on different edited environments and show that these edit methods are complementary. Code and data are available at https://github.com/jialuli-luka/EnvEdit
研究动机与目标
- 解决由于训练环境有限且缺乏多样性,导致视觉-语言导航(VLN)智能体泛化能力差的问题。
- 克服现有数据增强方法无法引入真正新颖环境变化的局限性。
- 开发一种可扩展、可解释的方法,用于生成语义一致但视觉多样的合成环境,以供训练使用。
- 通过在受控的语义和视觉变化下,向智能体暴露训练环境的编辑版本,提升其对未见环境的鲁棒性。
- 证明通过编辑实现的环境级数据增强,能在多个VLN基准和智能体架构上带来一致的性能提升。
提出的方法
- 通过使用来自艺术绘画的预训练风格嵌入进行风格迁移,生成合成环境,在保持原始布局和语义的同时改变视觉风格。
- 应用图像生成技术,基于语义分割图修改物体外观,引入视觉多样性,同时不改变场景语义。
- 通过在语义分割图中随机遮蔽1–4个物体类别,实现受控的语义编辑,创建物体组成不同的环境。
- 为所有合成环境重用原始的人工标注语言指令,以确保指令质量和语义一致性。
- 在真实环境与编辑后环境的组合上训练VLN智能体,使其学习到鲁棒的视觉-语义表征。
- 使用一种风格感知的说话者模型对未标注路径生成多样化指令,进一步提升泛化能力。
实验结果
研究问题
- RQ1通过编辑实现的环境级数据增强是否能提升VLN智能体在未见环境中的泛化能力?
- RQ2不同类型的环境编辑——风格、外观和物体类别——如何影响智能体性能与泛化能力?
- RQ3在训练中联合使用时,编辑后的环境在多大程度上能够相互补充?
- RQ4所提出的方法是否优于现有的数据增强策略,如特征丢弃或环境混合?
- RQ5在编辑过程中遮蔽的物体类别数量如何影响指令一致性与环境多样性之间的权衡?
主要发现
- 在R2R基准上,EnvEdit相较于非预训练基线模型,成功率达到绝对提升1.6%,创下新SOTA记录。
- 在多语言RxR数据集上,EnvEdit显著提升了所有指标的表现,适用于预训练和非预训练智能体。
- 通过风格迁移编辑(E_st)训练的环境,使在Environment 5上的成功率提升15.0%,SPL提升13.8%。
- 通过修改物体外观(E_is1)的编辑在Environment 1上带来了最大的性能提升,成功率提高15.0%,表明与视觉外观变化高度对齐。
- 在编辑过程中遮蔽一个物体类别时,实现了多样性与指令一致性的最佳平衡,优于遮蔽两个至四个类别的编辑方式。
- 对在多个编辑环境中训练的智能体进行集成(例如E_st、E_is1、E_is1^m),进一步提升了泛化能力,证明了不同编辑策略具有互补性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。