Skip to main content
QUICK REVIEW

[논문 리뷰] Winoground: Probing Vision and Language Models for Visio-Linguistic Compositionality

Tristan Thrush, Ryan Jiang|arXiv (Cornell University)|2022. 04. 07.
Multimodal Machine Learning Applications인용 수 14
한 줄 요약

Winoground는 비슷한 단어 조합을 다르게 배열한 문장들 사이에서 이미지와 문장을 매칭시키는 방식으로, 시각-언어 모델의 복합적 추론 능력을 평가하기 위한 새로운 탐사 데이터셋을 제안한다. 놀랍게도 최신 기술 모델들은 랜덤 추측 수준 이외의 성능을 내지 못해, 이질적 모odal 간 복합적 구조 이해에 심각한 결함이 있음을 드러낸다.

ABSTRACT

We present a novel task and dataset for evaluating the ability of vision and language models to conduct visio-linguistic compositional reasoning, which we call Winoground. Given two images and two captions, the goal is to match them correctly - but crucially, both captions contain a completely identical set of words, only in a different order. The dataset was carefully hand-curated by expert annotators and is labeled with a rich set of fine-grained tags to assist in analyzing model performance. We probe a diverse range of state-of-the-art vision and language models and find that, surprisingly, none of them do much better than chance. Evidently, these models are not as skilled at visio-linguistic compositional reasoning as we might have hoped. We perform an extensive analysis to obtain insights into how future work might try to mitigate these models' shortcomings. We aim for Winoground to serve as a useful evaluation set for advancing the state of the art and driving further progress in the field. The dataset is available at https://huggingface.co/datasets/facebook/winoground.

연구 동기 및 목표

  • 시각과 언어 모odal 간 복합적 추론 능력을 철저히 평가할 수 있는 새로운 벤치마크를 개발하는 것.
  • 최신 기술 모델이 단어 순서만 다를 뿐인 문장 쌍과 이미지를 정확히 매칭할 수 있는지 조사하는 것, 이는 인간에게는 매우 단순한 작업이다.
  • 모델 행동의 세밀한 분석을 통해 현재의 다중모달 아키텍처에서 발생하는 실패 원인과 성능 저하 요인을 규명하는 것.
  • 세밀한 태그가 부여된 풍부한 애너테이션 데이터셋을 제공하여 모델 능력에 대한 세밀한 진단 평가를 가능하게 하는 것.
  • 현재 모델들이 시각-언어 이해에서 복합적 구조를 다루는 데에 미치는 한계를 드러내어 향후 연구를 이끄는 것.

제안 방법

  • Winoground 데이터셋은 두 장의 이미지와 두 개의 문장 쌍을 포함하며, 두 문장 모두 정확히 동일한 단어를 사용하지만 순서가 다르다.
  • 각 이미지-문장 쌍은 단어 순서의 변화로 인해 시각적 장면이 근본적으로 달라지게 구성되어 있어, 정확한 매칭을 위해서는 복합적 추론이 필요하다.
  • 전문 애너테이터가 수작업으로 커리티드한 데이터셋으로, 시각적 및 언어적 특성에 따라 세밀한 태그가 부여되어 성능 분석에 유용하다.
  • 단일 스트림 및 이중 스트림 아키텍처를 포함한 다양한 11종의 최신 시각-언어 모델이 Winoground 벤치마크에서 평가되었다.
  • 모델 성능은 세 가지 지표로 측정되었다: 텍스트 점수(문장 기반으로 정확한 이미지 매칭), 이미지 점수(이미지 기반으로 정확한 문장 매칭), 그룹 점수(이미지-문장 쌍을 모두 정확히 매칭하는 데 성공한 비율).
  • 분석에는 단어-영역 주의도 히트맵, 문장의 어휘 어려움, 길이, 모델 점수 간 상관관계 분석, 아키텍처, 주의 메커니즘, 사전학습 데이터 크기별 성능 평가가 포함되었다.
(b)
(b)

실험 결과

연구 질문

  • RQ1시각-언어 모델은 단어 순서만 다른 동일한 단어 조합을 가진 문장 쌍과 이미지를 얼마나 정확히 매칭할 수 있는가? 이는 복합적 추론이 요구되는 작업이다.
  • RQ2표준 시각-언어 벤치마크에서 뛰어난 성능을 보이는 최신 모델들이 이 작업에서 왜 극적으로 실패하는가?
  • RQ3모델 아키텍처(단일 스트림 대 이중 스트림), 주의 메커니즘, 사전학습 데이터 크기가 복합적 추론 작업 성능에 어떤 영향을 미치는가?
  • RQ4모델 행동에서 지배적인 실패 유형은 무엇이며, 이는 예제의 언어적 및 시각적 복잡성과 어떻게 관련이 있는가?
  • RQ5문장의 어휘 어려움이나 길이와 같은 언어적 특성으로 모델 성능을 예측할 수 있는가? 이는 인간의 성능과 어떻게 관련되는가?

주요 결과

  • 시험한 모든 시각-언어 모델이 Winoground 벤치마크에서 랜덤 추측 수준 이외의 성능을 내지 못했으며, 대부분의 모델이 그룹 점수에서 거의 0%에 가까운 성능을 보였다.
  • ViLLA의 대규모 체크포인트만이 랜덤 성능을 초월했으며, 유의미한 개선은 0.00013의 신뢰 구간 차이로만 나타나 매우 미미한 향상이었다.
  • 공액 주의 메커니즘을 갖춘 모델들조차도 단어 순서만 다를 경우 이미지와 문장을 정확히 매칭하지 못했다.
  • 문장 길이와 모델 성능 사이에 유의미한 음의 상관관계가 있었으며, 더 긴 문장일수록 성능이 떨어져 언어 인코딩의 한계를 시사했다.
  • 모델 성능은 어휘 어려움에 대해 약한 상관관계를 보였으며, 낮은 어휘 어려움을 가진 문장에 더 높은 점수를 부여하는 경향이 있었지만, 이는 정확한 매칭으로 이어지지 않았다.
  • 더 큰 사전학습 데이터셋을 사용한 모델일수록 성능이 뚜렷하게 향상되었으며, 특히 CLIP와 FLAVA를 이상치로 간주할 경우 더욱 뚜렷한 추세를 보였다. 이는 스케일이 복합적 추론에서 핵심 요소임을 시사한다.
Figure 4 : Word-region alignment scores between the image and text features for ViLT [ 40 ] on examples from Winoground. In this case study, ViLT appears to disregard the information from adjectives. E.g., the heatmaps highlight the brown dog just as strongly regardless of whether the text was “brow
Figure 4 : Word-region alignment scores between the image and text features for ViLT [ 40 ] on examples from Winoground. In this case study, ViLT appears to disregard the information from adjectives. E.g., the heatmaps highlight the brown dog just as strongly regardless of whether the text was “brow

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.