Skip to main content
QUICK REVIEW

[논문 리뷰] EnvEdit: Environment Editing for Vision-and-Language Navigation

Jialu Li, Hao Tan|arXiv (Cornell University)|2022. 03. 29.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

이 논문은 시각-언어 탐색(VLN)에서 스타일, 객체 외관, 객체 클래스를 편집함으로써 다양한 합성 환경을 생성하는 데이터 증강 방법인 EnvEdit을 제안한다. 스타일 전이와 이미지 합성 기법을 사용하여 의미적으로 일관되지만 시각적으로는 다样的한 환경를 생성함으로써, 에이전트가 미리 보지 않은 설정으로 일반화하는 데에 도움을 주며, R2R 및 RxR 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하여 성공률이 1.6%p 향상되었다.

ABSTRACT

In Vision-and-Language Navigation (VLN), an agent needs to navigate through the environment based on natural language instructions. Due to limited available data for agent training and finite diversity in navigation environments, it is challenging for the agent to generalize to new, unseen environments. To address this problem, we propose EnvEdit, a data augmentation method that creates new environments by editing existing environments, which are used to train a more generalizable agent. Our augmented environments can differ from the seen environments in three diverse aspects: style, object appearance, and object classes. Training on these edit-augmented environments prevents the agent from overfitting to existing environments and helps generalize better to new, unseen environments. Empirically, on both the Room-to-Room and the multi-lingual Room-Across-Room datasets, we show that our proposed EnvEdit method gets significant improvements in all metrics on both pre-trained and non-pre-trained VLN agents, and achieves the new state-of-the-art on the test leaderboard. We further ensemble the VLN agents augmented on different edited environments and show that these edit methods are complementary. Code and data are available at https://github.com/jialuli-luka/EnvEdit

연구 동기 및 목표

  • 제한적이고 다양성이 떨어지는 훈련 환경로 인해 시각-언어 탐색(VLN) 에이전트의 일반화 능력이 떨어지는 문제를 해결하기 위해.
  • 기존 데이터 증강 방법이 진정으로 새로운 환경적 변형을 도입하지 못하는 한계를 극복하기 위해.
  • 의미적으로 일관되지만 시각적으로 다양성이 있는 합성 환경를 생성하기 위한 확장 가능하고 해석 가능한 방법을 개발하기 위해.
  • 훈련 환경의 편집된 버전을 통해 의미적 및 시각적 변화를 통제적으로 노출시킴으로써, 에이전트가 새로운 환경에 대해 더 견고해지도록 하기 위해.
  • 편집을 통한 환경 수준의 데이터 증강이 다양한 VLN 벤치마크와 에이전트 아키텍처에서 일관된 성능 향상을 이끌어내는지 입증하기 위해.

제안 방법

  • 예술적 풍경화에서 학습된 스타일 임베딩을 사용하여 스타일 전이를 적용함으로써, 원래의 레이아웃과 의미를 유지하면서도 시각적 스타일만 변경하는 합성 환경를 생성한다.
  • 세분화 맵을 기반으로 이미지 합성 기법을 적용하여 객체 외관을 수정함으로써, 환경의 의미를 유지하면서도 시각적 다양성을 도입한다.
  • 세분화 맵에서 무작위로 1~4개의 객체 클래스를 마스킹하여 의미적 편집을 통제적으로 수행함으로써, 객체 구성이 변경된 환경를 생성한다.
  • 모든 합성 환경에 대해 원본 인간 레이블링 언어 지시문을 재사용함으로써 지시문 품질과 의미 일관성을 보장한다.
  • 실제 환경와 편집된 환경의 조합으로 VLN 에이전트를 훈련시켜, 강력한 시각-의미적 표현을 학습하도록 한다.
  • 편집된 경로에 대해 애초에 레이블링되지 않은 지시문을 생성하는 스타일 인식 스피커 모델을 사용해 에이전트를 미세조정함으로써 일반화 능력을 추가로 향상시킨다.

실험 결과

연구 질문

  • RQ1편집을 통한 환경 수준의 데이터 증강이 VLN 에이전트의 새로운 환경에 대한 일반화 능력을 향상시키는가?
  • RQ2스타일, 외관, 객체 클래스와 같은 다양한 유형의 환경 편집이 에이전트 성능과 일반화에 어떤 영향을 미치는가?
  • RQ3다양한 편집 방식을 함께 사용할 경우, 상호 보완적인 효과가 어느 정도까지 나타나는가?
  • RQ4기존의 데이터 증강 전략(예: 특징 제거 또는 환경 혼합)에 비해 제안된 방법이 더 우수한가?
  • RQ5편집 중 마스킹하는 객체 클래스의 수가 지시문 일관성과 환경 다양성 사이의 트레이드오프에 어떤 영향을 미치는가?

주요 결과

  • EnvEdit는 R2R 벤치마크에서 미사전처리 기반 모델에 비해 성공률이 1.6%p 향상되어 새로운 최고 기록을 수립했다.
  • 다국어 RxR 데이터셋에서, EnvEdit은 사전학습된 모델과 사전학습되지 않은 모델 모두에서 모든 지표에서 성능 향상을 뚜렷이 보였다.
  • 스타일 전이를 통한 환경 편집(E_st)을 통해 Environment 5에서 성공률이 15.0% 향상되었고, SPL은 13.8% 향상되었다.
  • 객체 외관 편집(E_is1)은 Environment 1에서 가장 큰 성능 향상을 보였으며, 성공률이 15.0% 향상되어 시각적 외관 변화와의 강한 일치를 보였다.
  • 편집 중 하나의 객체 클래스만 마스킹했을 때가 다양성과 지시문 일관성 사이의 최적 균형을 이룩했으며, 두 개에서 네 개의 클래스를 마스킹한 경우보다 성능이 뛰어났다.
  • 다양한 편집 환경(예: E_st, E_is1, E_is1^m)에서 훈련된 에이전트를 앙상블함으로써 일반화 능력이 추가로 향상되었으며, 다양한 편집 전략이 상호 보완적임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.