Skip to main content
QUICK REVIEW

[논문 리뷰] Large-Scale Adversarial Training for Vision-and-Language Representation Learning

Zhe Gan, Yen-Chun Chen|arXiv (Cornell University)|2020. 06. 11.
Multimodal Machine Learning Applications참고 문헌 89인용 수 287
한 줄 요약

Villa는 이미지와 텍스트 두 모달리티의 임베딩을 교란시켜 비전-언어 모델에 대한 대규모 적대적 학습을 도입하고, 두 단계 프레임워크(적대적 사전 학습과 적대적 미세조정)로 다수의 V+L 태스크에서 최신 성능를 달성한다.

ABSTRACT

We present VILLA, the first known effort on large-scale adversarial training for vision-and-language (V+L) representation learning. VILLA consists of two training stages: (i) task-agnostic adversarial pre-training; followed by (ii) task-specific adversarial finetuning. Instead of adding adversarial perturbations on image pixels and textual tokens, we propose to perform adversarial training in the embedding space of each modality. To enable large-scale training, we adopt the "free" adversarial training strategy, and combine it with KL-divergence-based regularization to promote higher invariance in the embedding space. We apply VILLA to current best-performing V+L models, and achieve new state of the art on a wide range of tasks, including Visual Question Answering, Visual Commonsense Reasoning, Image-Text Retrieval, Referring Expression Comprehension, Visual Entailment, and NLVR2.

연구 동기 및 목표

  • 강건한 다중 모달 사전 학습의 동기를 제시하고 다운스트림 V+L 태스크에서 일반화 성능을 향상시킨다.
  • 확장성과 효과를 위해 픽셀/토큰 공간이 아닌 임베딩 공간에서의 적대적 학습을 제안한다.
  • 다수의 V+L 아키텍처에 걸친 두 단계적 적대적 학습(사전 학습과 미세 조정)을 입증한다.
  • 다양한 비전-언어 벤치마크에서 경험적 이점을 보인다.

제안 방법

  • 이미지 및 텍스트 모달리티 모두에서 임베딩 공간에 적대적 교란을 적용하고, 이미지 영역 특징과 단어 임베딩에 교란을 더한다.
  • 태스크 비의존적 적대적 사전 학습 후 태스크 특이적 적대적 미세 조정의 두 단계 학습 체계를 사용한다.
  • 대규모 학습을 가능하게 하는 “Free” 적대적 학습 전략을 채택해 여러 PGD 단계에 걸쳐 그래디언트를 누적한다.
  • KL-발산 기반 항으로 교란에 대한 자신감의 연속성을 촉진하고 방어 능력을 강화한다.
  • 표준 손실, 적대적 학습 손실, KL 기반 정규화를 결합한 합성 목적함수를 최적화한다.
  • MLM 및 ITM 사전 학습 과제와 다운스트림 미세 조정(VQA, VCR 등)에서도 적대적 학습을 적용한다.

실험 결과

연구 질문

  • RQ1임베딩 공간의 적대적 교란이 다양한 태스크에서 비전-언어 모델의 일반화를 개선할 수 있는가?
  • RQ2적대적 사전 학습과 적대적 미세 조정이 표준 학습 대비 V+L 모델에 산술적 이득을 더해 주는가?
  • RQ3대규모 V+L 학습에서 이미지 특징이나 텍스트 임베딩(또는 둘 다)을 교란하는 것이 더 이로운가?
  • RQ4“Free” 적대적 학습 체제가 대규모 학습의 효율성과 성능에 어떤 영향을 미치는가?

주요 결과

  • Villa는 UNITER(base 및 large)에 적용했을 때 여섯 개의 V+L 태스크에서 일관되게 최첨단 성능을 개선하며, finetuning 단계에서 LXMERT의 성능도 향상시킨다.
  • Villa-base는 UNITER-base 대비 Q→AR에서 VQA를 +0.76, VCR을 +2.4 향상시키고, Villa-large는 더 큰 이득으로 VQA와 VCR의 성능을 향상시키며(예: VCR Q→AR +2.9).
  • 적대적 사전 학습과 적대적 미세 조정은 각각 성능을 높이고, 두 가지를 결합하면 가장 큰 이득을 얻는다.
  • 이미지 특징만 교란하거나 텍스트 임베딩만 교란하는 경우 모두 상당한 개선을 제공하며, 이미지 교란은 여러 태스크에서 주목할 만한 이득을 준다.
  • Villa는 ablations에서 FreeLB보다 우수하며, 다중 모달 정렬에 대한 탐침 신호(예: 시각적 핵심참조 및 관계에 대한 주의 증가)를 더 잘 얻는다.
  • LXMERT(미세 조정만 적용)에 Villa를 적용하면 VQA, GQA, NLVR2 전반에서 평균 약 +0.88의 이득을 얻는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.