Skip to main content
QUICK REVIEW

[논문 리뷰] Benchmarking Robustness of Multimodal Image-Text Models under Distribution Shift

Jielin Qiu, Yi Zhu|arXiv (Cornell University)|2022. 12. 15.
Multimodal Machine Learning Applications인용 수 8
한 줄 요약

이 논문은 5개의 작업을 통해 12개의 오픈소스 다중모态 이미지-텍스트 모델의 분포 이탈 상황에서의 강건성 평가를 위한 종합적 벤치마크를 소개한다. 17종의 이미지 및 16종의 텍스트 변형 기법을 사용하여 평가한다. 줌 블러와 문자 수준의 텍스트 변형이 가장 치명적인 이탈으로 나타났으며, 이러한 이탈 상황에서의 모델 성능 저하를 더 정확히 평가하기 위해 두 가지 새로운 지표인 MMI와 MOR을 제안한다.

ABSTRACT

Multimodal image-text models have shown remarkable performance in the past few years. However, evaluating robustness against distribution shifts is crucial before adopting them in real-world applications. In this work, we investigate the robustness of 12 popular open-sourced image-text models under common perturbations on five tasks (image-text retrieval, visual reasoning, visual entailment, image captioning, and text-to-image generation). In particular, we propose several new multimodal robustness benchmarks by applying 17 image perturbation and 16 text perturbation techniques on top of existing datasets. We observe that multimodal models are not robust to image and text perturbations, especially to image perturbations. Among the tested perturbation methods, character-level perturbations constitute the most severe distribution shift for text, and zoom blur is the most severe shift for image data. We also introduce two new robustness metrics ( extbf{MMI} for MultiModal Impact score and extbf{MOR} for Missing Object Rate) for proper evaluations of multimodal models. We hope our extensive study sheds light on new directions for the development of robust multimodal models. More details can be found on the project webpage: \url{https://MMRobustness.github.io}.

연구 동기 및 목표

  • 실세계 적용에 있어 매우 중요한 분포 이탈 상황에서 다중모달 이미지-텍스트 모델의 강건성을 체계적으로 평가하기 위해.
  • 이미지 및 텍스트 변형에 의한 다중모달 강건성에 대한 표준화된 벤치마크 부족 문제를 해결하기 위해.
  • 다중모달 환경에서 이미지 및 텍스트 모odal의 가장 치명적인 변형 유형을 특정하기 위해.
  • 더 정확한 평가를 위해 상대적 성능 저하를 정량화하는 데 도움이 되는 두 가지 새로운 강건성 지표—MMI(MultiModal Impact score) 및 MOR(Missing Object Rate)—를 제안하기 위해.
  • 주의도 분석과 최적 운반(Optimal Transport) 정렬을 통해 성능 저하의 해석 가능성을 제공하기 위해.

제안 방법

  • COCO, Flicker30K, NLVR2, SNLI-VE, COCO 등의 기존 데이터셋에 17종의 이미지 변형(예: 블러, 노이즈, 픽셀화)과 16종의 텍스트 변형(예: 철자 오류, 동의어 교체, OCR 오류)을 적용하여 다중모달 강건성 벤치마크를 구축하였다.
  • 이미지-텍스트 검색, 시각적 추론, 시각적 함의, 이미지 캡션 생성, 텍스트 기반 이미지 생성의 5개 작업을 통해 12개의 오픈소스 다중모달 모델을 평가하였다.
  • 분포 이탈 상황에서 모든 5개 작업에 걸쳐 상대적 성능 저하를 정량화하기 위해 MultiModal Impact score(MMI)를 제안하였다.
  • 특히 텍스트 기반 이미지 생성 강건성 평가에 특화된 오픈세트 언어 유도 객체 탐지 기반 Missing Object Rate(MOR) 지표를 도입하였다.
  • 주의도 시각화와 최적 운반 정렬을 사용하여 변형에 의한 모델 행동 변화를 해석하였다.
  • 프로젝트 웹사이트(https://MMRobustness.github.io)를 통해 코드, 데이터셋, 결과를 공개하였다.

실험 결과

연구 질문

  • RQ1다중모달 모델에서 가장 심각한 분포 이탈을 유도하는 이미지 및 텍스트 변형 유형은 무엇인가?
  • RQ2다양한 이미지 및 텍스트 변형 상황에서 여러 후행 작업을 통해 다양한 다중모달 모델의 성능은 어떻게 나타나는가?
  • RQ3이미지 및 텍스트 변형이 다중모달 모델의 성능을 어느 정도 저하시키며, 어느 모달이 더 민감한가?
  • RQ4제안된 MMI 및 MOR 지표는 다중모달 시스템의 강건성 저하를 효과적으로 캡처하는가?
  • RQ5변형 상황에서 성능 저하의 근본 원인은 무엇이며, 주의도와 정렬 메커니즘은 이를 어떻게 설명할 수 있는가?

주요 결과

  • 다중모달 모델은 분포 이탈 상황에서 상당한 성능 저하를 보이며, 이미지 변형이 텍스트 변형보다 더 심각한 영향을 미친다.
  • 이미지 변형 중에서 줌 블러가 특히 이미지 캡션 생성 및 텍스트 기반 이미지 생성 작업에서 모델 성능 저하에 가장 효과적인 것으로 나타났다.
  • 텍스트 변형에서는 단어 수준이나 문장 수준의 변화보다 문자 수준의 수정(예: 철자 오류, 키보드 오류)이 더 강한 부정적 영향을 미쳤다.
  • 제안된 MMI 지표는 다양한 모델과 작업 간의 상대적 강건성을 효과적으로 캡처하였으며, 변형 상황에서 일관된 성능 저하 경향을 보였다.
  • MOR 지표는 텍스트 기반 이미지 생성 모델이 변형, 특히 문자 수준의 편집에 노출되었을 때 프롬프트에 언급된 객체를 자주 생성하지 못함을 드러내었다.
  • 주의도 시각화와 최적 운반 분석을 통해 변형이 시각적 특징과 텍스트 토큰 간의 다중모달 주의도 정렬을 특히 파괴함을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.