Skip to main content
QUICK REVIEW

[논문 리뷰] Are Multimodal Transformers Robust to Missing Modality?

Mengmeng Ma, Jian Ren|arXiv (Cornell University)|2022. 04. 12.
Infrastructure Maintenance and Monitoring인용 수 5
한 줄 요약

이 논문은 다중모odal 트랜스포머가 누락된 모odal에 대해 얼마나 강건한지 조사하며, 그 결과 이들의 성능은 매우 민감하며 최적의 융합 전략은 데이터셋에 따라 달라지며 보편적이지 않음을 발견한다. 이를 해결하기 위해 저자는 최적의 융합 레이어를 자동으로 탐색할 수 있는 미분 가능 검색을 포함한 다중 작업 학습 프레임워크를 제안하며, 세 가지 벤치마크에서 누락된 모달 조건 하에서도 성능을 크게 향상시킨다.

ABSTRACT

Multimodal data collected from the real world are often imperfect due to missing modalities. Therefore multimodal models that are robust against modal-incomplete data are highly preferred. Recently, Transformer models have shown great success in processing multimodal data. However, existing work has been limited to either architecture designs or pre-training strategies; whether Transformer models are naturally robust against missing-modal data has rarely been investigated. In this paper, we present the first-of-its-kind work to comprehensively investigate the behavior of Transformers in the presence of modal-incomplete data. Unsurprising, we find Transformer models are sensitive to missing modalities while different modal fusion strategies will significantly affect the robustness. What surprised us is that the optimal fusion strategy is dataset dependent even for the same Transformer model; there does not exist a universal strategy that works in general cases. Based on these findings, we propose a principle method to improve the robustness of Transformer models by automatically searching for an optimal fusion strategy regarding input data. Experimental validations on three benchmarks support the superior performance of the proposed method.

연구 동기 및 목표

  • 실제 데이터에서 누락된 모달이 존재할 경우 다중모달 트랜스포머의 강건성을 조사한다.
  • 기존 융합 전략(조기, 후기, 중간)이 누락된 모달 조건에서 다양한 데이터셋 간에 일반화되는지 확인한다.
  • 누락된 모달 조건에서 보편적인 융합 전략이 부족한 문제를 해결하기 위해, 데이터셋 특성에 따라 최적의 융합을 자동으로 학습하는 방법을 개발한다.
  • 완전한 데이터와 불완전한 데이터를 동시에 최적화하여 모델의 강건성을 향상시키고, 누락된 모달 상황에서도 더 나은 일반화를 가능하게 한다.

제안 방법

  • 완전한 모달과 불완전한 모달 데이터를 동시에 학습하는 다중 작업 학습 프레임워크를 제안하여 강건성을 향상시킨다.
  • 최적의 융합 레이어 탐색을 양단 최적화 문제로 공식화하여, 융합 전략에 대한 엔드 투 엔드 미분 가능한 학습을 가능하게 한다.
  • 추론 중에 분류 토큰이 관련이 없는 모달에 주의를 기울이지 않도록 모달별 주의 마스크를 도입한다.
  • 입력 샘플 별로 최적의 융합 레이어 깊이를 예측하는 학습 가능한 정책 네트워크를 사용하여 입력의 모달 가용성에 따라 동적으로 적응한다.
  • 완전한 데이터에 대한 교차 엔트로피 손실과 불완전한 데이터에 대한 정규화된 손실을 조합하여 성능 유지 전략을 수립한다.
  • 기울기 기반 최적화를 통해 융합 전략과 모델 파라미터를 동시에 업데이트하여 융합 구성에 대한 효율적인 탐색을 가능하게 한다.

실험 결과

연구 질문

  • RQ1다중모달 트랜스포머는 누락된 모달 조건에서 어떻게 성능을 내는가? 특히 단모달 기준선과 비교했을 때 어떻게 되는가?
  • RQ2융합 전략(조기, 후기, 중간)의 선택이 누락된 모달 조건에서 모델의 강건성에 크게 영향을 미치는가?
  • RQ3모달이 누락되었을 때 다양한 데이터셋 간에 통용 가능한 융합 전략이 존재하는가?
  • RQ4불완전한 데이터를 포함한 다중 작업 학습이 표준 사전학습에 비해 강건성을 향상시키는가?
  • RQ5각 데이터셋 또는 입력 별로 최적의 융합 레이어를 탐색하기 위해 미분 가능한 검색이 얼마나 효과적인가?

주요 결과

  • 다중모달 트랜스포머는 모달이 누락될 경우 성능이 크게 떨어지며, 특히 텍스트 모달이 심하게 감소한 경우 일부 데이터셋에서 단모달 기준선 이하로 떨어진다.
  • MM-IMDb와 Hateful Memes에서는 조기 융합이 후기 융합보다 성능이 뛰어나지만, UPMC Food-101에서는 후기 융합이 더 우수하여 최적의 전략이 데이터셋에 따라 달라짐을 입증한다.
  • MM-IMDb에서 10% 텍스트 조건 하에 46.6 F1-Macro를 기록하며, 새로운 기준선(40.4)과 단일 이미지 기반 기준선(31.2)을 모두 초월하여 강건성을 입증한다.
  • UPMC Food-101에서 10% 텍스트 조건 하에 77.5% 정확도를 달성하며, 새로운 기준선(44.3%)과 단일 이미지 기반 기준선(65.9%)을 모두 뛰어넘어 일관된 성능 향상을 보였다.
  • 정밀 분석 결과, 다중 작업 학습이 융합 전략 탐색보다 더 강건성 향상에 기여하며, 텍스트가 10%일 경우 성능을 30% 향상시킨다.
  • 주의 마스크는 핵심적이다: 제거할 경우 MM-IMDb에서 F1-Macro는 37.3에서 23.0으로 감소하여, 추론 중 모달 간 간섭을 방지하기 위해 모달 격리가 필수적임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.