[논문 리뷰] Probing Inter-modality: Visual Parsing with Self-Attention for Vision-Language Pre-training
이 논문은 비전-언어 사전학습(VLP)을 위한 완전히 트랜스포머 기반의 시각적 임bedding을 제안하며, CNN을 대체하여 자기주의(self-attention)를 통해 장거리 시각적 관계를 더 잘 포착한다(시각적 파싱). 상호모달 최적화를 위해 마스크된 특징 회귀(MFR)를 도입하고, 교차모달 상호작용을 측정하기 위해 상호모달 플로우(IMF)를 제안하여 다양한 비전-언어 작업에서 최신 기술 성능(SOTA)을 달성하면서도 뛰어난 상호모달 정렬 능력을 보여준다.
Vision-Language Pre-training (VLP) aims to learn multi-modal representations from image-text pairs and serves for downstream vision-language tasks in a fine-tuning fashion. The dominant VLP models adopt a CNN-Transformer architecture, which embeds images with a CNN, and then aligns images and text with a Transformer. Visual relationship between visual contents plays an important role in image understanding and is the basic for inter-modal alignment learning. However, CNNs have limitations in visual relation learning due to local receptive field's weakness in modeling long-range dependencies. Thus the two objectives of learning visual relation and inter-modal alignment are encapsulated in the same Transformer network. Such design might restrict the inter-modal alignment learning in the Transformer by ignoring the specialized characteristic of each objective. To tackle this, we propose a fully Transformer visual embedding for VLP to better learn visual relation and further promote inter-modal alignment. Specifically, we propose a metric named Inter-Modality Flow (IMF) to measure the interaction between vision and language modalities (i.e., inter-modality). We also design a novel masking optimization mechanism named Masked Feature Regression (MFR) in Transformer to further promote the inter-modality learning. To the best of our knowledge, this is the first study to explore the benefit of Transformer for visual feature learning in VLP. We verify our method on a wide range of vision-language tasks, including Image-Text Retrieval, Visual Question Answering (VQA), Visual Entailment and Visual Reasoning. Our approach not only outperforms the state-of-the-art VLP performance, but also shows benefits on the IMF metric.
연구 동기 및 목표
- 비전-언어 사전학습에서 장거리 시각적 관계를 모델링하는 데 어려움을 겪는 CNN의 한계를 해결하기 위해.
- 비전-언어 모델에서 자기주의를 활용한 시각적 특징 학습의 이점을 탐색하여 CNN 기반의 시각 인코더를 넘어서기 위해.
- 언어에 의해 유도되는 시각적 표현 학습을 촉진하기 위해, 시각적 파싱 의존성에 기반한 새로운 마스킹 메커니즘(MFR)을 설계하기 위해.
- 훈련 중에 비전과 언어 모달 간의 정보 흐름을 정량화하고 탐색하기 위해 상호모달 플로우(IMF)를 메트릭으로 도입하기 위해.
- 다양한 비전-언어 작업에서 제안된 방법의 효과성을 평가하고, 제거 및 탐색 연구를 통해 상호모달 융합 역학을 분석하기 위해.
제안 방법
- 자기주의를 통해 전역적이고 장거리 시각적 관계 모델링이 가능한, 완전히 트랜스포머 기반의 시각적 임베딩 네트워크로 CNN 기반의 시각 인코더를 대체하여, 자기주의를 통한 장거리 시각적 관계 모델링을 가능하게 한다.
- 각 시각적 토큰이 학습된 주의 가중치를 통해 다른 모든 토큰을 주시하는 방식으로, 시각적 특징 내의 토큰 간 의존성 학습을 위한 '시각적 파싱'을 도입한다.
- 고의존성 시각 토큰을 마스킹하여 다중모달 트랜스포머가 언어 신호에 더 의존하도록 유도하는 새로운 마스킹 최적화 메커니즘인 마스크된 특징 회귀(MFR)를 설계한다.
- 입력에서 출력으로의 어텐션 흐름을 트랜스포머 레이어 전반에 걸쳐 계산하여, 비전과 언어 모달 간의 정보 흐름을 정량화하는 레이어별 메트릭으로 상호모달 플로우(IMF)를 제안한다.
- 표준 VLP 목표(MLM, MFR)로 종단간 훈련을 수행하면서 IMF를 진단 도구로 사용해 모달 간 상호작용 역학을 분석한다.
- 각 레이어의 시각적 및 언어적 특징에 대해 k-means 클러스터링을 수행하고, 정규화된 상호정보량(NMI)을 계산하여 데이터 분포 융합 수준을 평가하며, IMF와 보완적인 분석을 제공한다.
실험 결과
연구 질문
- RQ1완전히 트랜스포머 기반의 시각 인코더가 비전-언어 사전학습에서 CNN 기반 인코더를 능가할 수 있는가? 특히, 시각적 관계 학습과 상호모달 정렬 향상 측면에서.
- RQ2자기주의를 통한 시각적 파싱은 CNN의 국소적 수용장( receptive fields)과 비교해 장거리 시각적 의존성을 어떻게 향상시키는가?
- RQ3제안된 MFR 마스킹 메커니즘이 고의존성 시각 토큰에 초점을 맞춰 교차모달 어텐션을 얼마나 향상시키는가?
- RQ4상호모달 플로우(IMF) 메트릭은 하류 작업 성능과 얼마나 잘 상관관계를 가지며, 실제로 모달 간 상호작용을 반영하는가?
- RQ5NMI를 통한 탐색적 데이터 분포 융합 분석과 IMF로부터 도출할 수 있는 통찰은 다양한 VLP 아키텍처에서 모달 간 상호작용의 정도와 역학을 어떻게 설명하는가?
주요 결과
- 제안된 완전히 트랜스포머 기반의 시각적 임베딩은 이미지-텍스트 검색, VQA, 시각적 함의, 시각적 추론 등 다양한 벤치마크에서 최신 기술(SOTA) 모델을 능가하는 성능을 달성한다.
- 모든 트랜스포머 레이어에서 일관되게 높은 상호모달 플로우(IMF) 점수를 기록하여, 비전과 언어 모달 간의 강력하고 지속적인 정보 흐름을 나타낸다.
- MFR는 고의존성 시각 토큰을 마스킹하여 모델이 정렬 과정에서 언어 컨텍스트에 더 의존하도록 유도함으로써 성능 향상에 기여한다.
- IMF 메트릭은 하류 작업 성능과 양의 상관관계를 보이며, 상호모달 학습에 대한 진단 도구로서의 효과성을 검증한다.
- 제거 연구를 통해 시각적 파싱과 MFR가 모두 필수적인 구성 요소임을 확인하였으며, 시각적 관계 모델링 향상과 교차모달 어텐션 강화에 기여한다.
- NMI 분석 결과, 종단간 시각 백본을 갖춘 모델(SOHO 및 본 논문의 모델)은 UNITER보다 낮은 NMI 점수를 유지함으로써 모달 간 분리가 감소하고 융합이 강화됨을 시사하지만, IMF는 NMI보다 상호작용를 더 정확하게 측정하는 데 기여한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.