Skip to main content
QUICK REVIEW

[논문 리뷰] Seeing past words: Testing the cross-modal capabilities of pretrained V&L models

Letiția Pârcălăbescu, Albert Gatt|arXiv (Cornell University)|2020. 12. 22.
Multimodal Machine Learning Applications참고 문헌 20인용 수 5
한 줄 요약

이 논문은 이미지-문장 쌍 식별 및 시각적 카운팅이라는 두 가지 다중모odal 추론 작업에서 사전학습된 시각-언어(V&L) 모델—ViLBERT, ViLBERT 12-in-1, LXMERT—을 평가한다. 정렬 작업에서는 뛰어난 성능을 보이지만, 특히 훈련 분포를 초월한 경우 실수를 범하는 엔티티 수를 세는 데에는 실패한다. 이는 데이터셋 편향과 낮은 시각적 엔티티 개별화 능력 때문이므로, 모델의 성능은 제한적이다.

ABSTRACT

We investigate the ability of general-purpose pretrained vision and language V&L models to perform reasoning in two tasks that require multimodal integration: (1) discriminating a correct image-sentence pair from an incorrect one, and (2) counting entities in an image. We evaluate three pretrained V&L models on these tasks: ViLBERT, ViLBERT 12-in-1 and LXMERT, in zero-shot and finetuned settings. Our results show that models solve task (1) very well, as expected, since all models use task (1) for pretraining. However, none of the pretrained V&L models are able to adequately solve task (2), our counting probe, and they cannot generalise to out-of-distribution quantities. Our investigations suggest that pretrained V&L representations are less successful than expected at integrating the two modalities. We propose a number of explanations for these findings: LXMERT's results on the image-sentence alignment task (and to a lesser extent those obtained by ViLBERT 12-in-1) indicate that the model may exhibit catastrophic forgetting. As for our results on the counting probe, we find evidence that all models are impacted by dataset bias, and also fail to individuate entities in the visual input.

연구 동기 및 목표

  • 사전학습된 시각-언어 모델이 사전학습 목표를 초월해 추론을 수행할 수 있는지 평가하기.
  • 이러한 모델이 시각적 카운팅 작업에서 훈련 데이터에 포함되지 않은 분포 외의 수량에 일반화할 수 있는지 조사하기.
  • 데이터셋 편향과 시각적 엔티티를 개별화하지 못하는 것이 다중모달 통합을 방해하는지 검토하기.
  • 사전학습 기간 동안 V&L 모델에서 치명적인 기억 상실(catastrophic forgetting)이 얼마나 발생하는지 평가하기.

제안 방법

  • 이미지-문장 정렬 및 시각적 카운팅이라는 두 작업에서 ViLBERT, ViLBERT 12-in-1, LXMERT라는 세 V&L 모델의 피지컬 튜닝 및 제로샷 평가를 수행한다.
  • 훈련 데이터에 존재하지 않는 새로운 수량에 대한 일반화 능력을 테스트하기 위해 제로샷 카운팅 프로브를 사용한다.
  • 어텐션 메커니즘과 특징 표현의 분석 및 아블레이션을 통해 모델 행동을 분석한다.
  • 모델 간 성능 비교를 통해 내성적 저항력과 일반화 능력의 차이를 식별한다.
  • 희귀하거나 분포 외의 예시에 대한 모델 예측을 프로빙하여 데이터셋 편향을 조사한다.
  • 이미지 내 개별 물체를 구분하고 세는 데 모델이 얼마나 잘하는지 분석함으로써 엔티티 개별화 능력을 평가한다.

실험 결과

연구 질문

  • RQ1사전학습된 V&L 모델은 사전학습 기간 동안 관찰한 범위를 초월한 엔티티 수를 세는 데 일반화할 수 있는가?
  • RQ2데이터셋 편향이 시각적 카운팅 작업에서 V&L 모델 예측의 신뢰성에 얼마나 큰 영향을 미치는가?
  • RQ3이미지-문장 정렬 작업에선 뛰어난 성능를 보이지만, 왜 V&L 모델은 시각적 카운팅 작업에선 성능이 열등한가?
  • RQ4특히 다중모달 추론 작업에서 사전학습 기간 동안 치명적인 기억 상실이 발생하는가?
  • RQ5V&L 모델은 시각 입력 내 물체를 얼마나 잘 개별화하는가? 그에 대한 증거는 무엇인가?

주요 결과

  • 세 모델 모두 사전학습 목표에 따라 예상되는 바와 같이 이미지-문장 정렬 작업에서 매우 우수한 성능를 보인다.
  • 모델 중 어느 것도 시각적 카운팅 프로브에서 충분한 성능를 내지 못했으며, 특히 분포 외 수량에 대해서는 더욱 심각한 성능 저하가 있었다.
  • LXMERT와 ViLBERT 12-in-1은 치명적인 기억 상실의 징후를 보였으며, 사전학습 후 정렬 작업 성능이 떨어졌다.
  • 데이터셋 편향은 모델 예측에 상당한 영향을 미쳤으며, 특히 희귀하거나 미사용된 수량에 대해 더욱 두드러졌다.
  • 모델은 시각적으로 구분 가능한 물체라도 정확히 개별화하지 못해 잘못된 카운팅을 유도했다.
  • 새로운 수량에 대한 일반화 능력은 열악했으며, 이는 사전학습된 V&L 표현에서 조합적 추론 능력의 부족을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.