Skip to main content
QUICK REVIEW

[논문 리뷰] MVPTR: Multi-Level Semantic Alignment for Vision-Language Pre-Training via Multi-Stage Learning

Zejun Li, Zhihao Fan|arXiv (Cornell University)|2022. 01. 29.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

MVPTR는 시각 및 언어 모odal에서 개체 수준와 어휘 수준의 의미를 명시적으로 모델링함으로써 다중 수준 의미 정렬을 향상시키는 이단계적 비전-언어 사전학습 프레임워크를 제안한다. 마스킹된 개념 복구 및 구조화된 어휘 지정 작업을 도입함으로써 MVPTR는 이미지-텍스트 검색, 시각적 지정, VQA 벤치마크에서 최신 기술 수준의 성능을 달성하며, 다중 모odal 표현 학습에서 계층적 정렬의 효과성을 입증한다.

ABSTRACT

Previous vision-language pre-training models mainly construct multi-modal inputs with tokens and objects (pixels) followed by performing cross-modality interaction between them. We argue that the input of only tokens and object features limits high-level semantic alignment like phrase-to-region grounding. Meanwhile, multi-level alignments are inherently consistent and able to facilitate the representation learning synergistically. Therefore, in this paper, we propose to learn Multi-level semantic alignment for Vision-language Pre-TRaining (MVPTR). In MVPTR, we follow the nested structure of both modalities to introduce concepts as high-level semantics. To ease the learning from multi-modal multi-level inputs, our framework is split into two stages, the first stage focuses on intra-modality multi-level representation learning, the second enforces interactions across modalities via both coarse-grained and fine-grained semantic alignment tasks. In addition to the commonly used image-text matching and masked language model tasks, we introduce a masked concept recovering task in the first stage to enhance the concept representation learning, and two more tasks in the second stage to explicitly encourage multi-level alignments across modalities. Our code is available at https://github.com/Junction4Nako/mvp_pytorch.

연구 동기 및 목표

  • 기존의 비전-언어 사전학습 모델이 토큰-영역 정렬에만 집중하여 어휘-영역 지정과 같은 고차원 의미 연결을 놓치는 한계를 해결하기 위해.
  • 양 모odal에서 중첩된 의미 개념을 구조화함으로써 단어, 어휘, 개체 수준의 의미를 상호보완적으로 학습할 수 있도록 하기 위해.
  • 이단계 학습 파라다임을 통해 내모달 표현 학습과 교차모달 상호작용을 분리함으로써 교차모달 정렬을 향상시키기 위해.
  • 장면 그래프에서 유도된 개념과 개체 태그를 앵커로 사용하여 어휘 수준의 의미를 명시적으로 모델링함으로써 최종 작업의 표현 품질을 향상시키기 위해.

제안 방법

  • 이단계 학습 프레임워크를 도입: 첫 번째 단계에서는 마스킹된 개념 복구(MCR)를 통한 시각 모달의 단일 모달 학습과 언어 모달의 어휘 인식 토큰 생성을 통해 다중 수준 표현을 구축한다.
  • 시각적 영역과 토큰 사이의 다중 수준 의미 연결을 위해 개체 태그와 장면 그래프에서 유도된 어휘 수준의 개념을 고차원 의미 단위로 통합한다.
  • 시각 및 언어 양측에서 마스킹된 개념 복구(MCR)를 활용하여 개체 태그를 시각적 영역과 정렬하고, 어휘를 관련 토큰과 정렬한다.
  • 두 번째 단계에서 굵은 수준과 미세 수준의 정렬 작업을 도입하여 다중 의미 수준에서 교차모달 상호작용을 강화한다.
  • 내모달 및 교차모달 주의를 분리하는 디센트된 주의 메커니즘을 활용하여 단일 모달 학습과 교차모달 학습 간 간섭을 방지한다.
  • 가중치 기반 어휘 지정(WPG)을 사용한 어휘 수준의 지정 작업을 도입하여 어휘와 시각적 영역 간의 관계를 명시적으로 모델링한다.

실험 결과

연구 질문

  • RQ1어휘, 어휘, 개체 수준의 의미를 명시적으로 모델링하면 토큰-영역 정렬을 넘어서 비전-언어 사전학습 성능을 향상시킬 수 있는가?
  • RQ2단일 모달 학습과 교차모달 학습 단계를 분리하는 것이 다중 수준 표현 학습 품질에 어떤 영향을 미치는가?
  • RQ3마스킹된 개념 복구 및 어휘 지정 작업을 도입함으로써 최종 비전-언어 벤치마크 성능에 어떤 영향을 미치는가?
  • RQ4개체 수준 및 어휘 수준의 의미가 비전-언어 모델에서 고차원 정렬을 위한 기초 구성 요소로 얼마나 기여하는가?

주요 결과

  • 제거 실험 결과, 개체 수준의 개념을 제거할 경우 이미지-텍스트 매칭 및 어휘 지정 성능이 크게 떨어지며, 이는 다중 수준 정렬에서의 기초적 역할을 확인한다.
  • WPG와 MCR를 통한 어휘 수준 의미의 명시적 모델링은 시각적 지정 및 미세 수준 매칭 성능을 각각 2.1%, 1.8% 향상시켜 구조화된 어휘 표현의 이점을 입증한다.
  • 이단계 프레임워크는 주의 간섭을 줄임으로써 엔드 투 엔드 모델을 능가하는 성능을 달성하여 MSCOCO, Flickr30k, VQA, SNLI-VE 벤치마크에서 최신 기술 수준 성능을 기록한다.
  • 시각화 결과, 모델이 어휘 개념(예: '군데의 코끼리')을 해당 시각적 영역과 정렬하는 것을 확인할 수 있으며, 어휘 수준의 주의 메커니즘의 효과성을 검증한다.
  • 모델은 다양한 데이터셋 간에 잘 일반화되며, '두 명의 남성'이나 '젊은 소년'과 같은 어휘가 MSCOCO, Flickr30k, VQA에서 빈번하고 일관되게 나타난다.
  • 장면 그래프에서 유도된 개념을 사용할 경우 어휘 표현이 더 강건해지며, 어휘 노드가 관련 이미지 영역에 정확히 연결된 정량적 주의 맵을 통해 이를 확인할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.