Skip to main content
QUICK REVIEW

[논문 리뷰] MARMOT: A Deep Learning Framework for Constructing Multimodal Representations for Vision-and-Language Tasks

Patrick Y. Wu, Walter R. Mebane|arXiv (Cornell University)|2021. 09. 23.
Multimodal Machine Learning Applications참고 문헌 9인용 수 5
한 줄 요약

MARMOT는 계산 비용이 큰 사전 훈련 대신 모odal 간 번역을 사용하여 시각-언어 작업을 위한 다중모달 표현을 구성하는 딥러닝 프레임워크입니다. 이로 인해 이미지나 텍스트가 누락된 경우에도 효과적인 표현 학습이 가능합니다. 2016년 미국 대선 기간의 선거 사고 트윗 분류에서 20개 카테고리 중 19개에서 텍스트 전용 모델을 능가했으며, 악성 멤즈 데이터셋에서 VisualBERT의 정확도를 2.87%p 향상시키고 AUC를 3.89%p 향상시켰습니다.

ABSTRACT

Political activity on social media presents a data-rich window into political behavior, but the vast amount of data means that almost all content analyses of social media require a data labeling step. However, most automated machine classification methods ignore the multimodality of posted content, focusing either on text or images. State-of-the-art vision-and-language models are unusable for most political science research: they require all observations to have both image and text and require computationally expensive pretraining. This paper proposes a novel vision-and-language framework called multimodal representations using modality translation (MARMOT). MARMOT presents two methodological contributions: it can construct representations for observations missing image or text, and it replaces the computationally expensive pretraining with modality translation. MARMOT outperforms an ensemble text-only classifier in 19 of 20 categories in multilabel classifications of tweets reporting election incidents during the 2016 U.S. general election. Moreover, MARMOT shows significant improvements over the results of benchmark multimodal models on the Hateful Memes dataset, improving the best result set by VisualBERT in terms of accuracy from 0.6473 to 0.6760 and area under the receiver operating characteristic curve (AUC) from 0.7141 to 0.7530.

연구 동기 및 목표

  • 정치학 연구에서 최신 시각-언어 모델의 한계를 해결하기 위해, 모든 샘플에서 이미지와 텍스트를 모두 필요로 하며 고비용 사전 훈련에 의존하는 문제를 해결하기 위해.
  • 이미지나 텍스트가 누락될 수 있는 다중모달 소셜 미디어 데이터에 대해 효과적인 표현 학습을 가능하게 하기 위해.
  • 계산 비용이 큰 사전 훈련을 모달 간 번역 기반 접근법으로 대체하여 교차 모달 관계를 효율적으로 학습하기 위해.
  • 다중모달 콘텐츠가 일반적이지만 불완전한 실세계 정치 및 소셜 미디어 데이터에서의 분류 성능을 향상시키기 위해.
  • 고성능 컴퓨팅 자원에 접근할 수 없는 사회과학자들이 사용할 수 있는 실용적이고 접근 가능한 프레임워크를 제공하기 위해.

제안 방법

  • MARMOT는 트랜스포머 기반 아키텍처를 사용하며, 한 모달리티에서 다른 모달리티를 재구성함으로써 공동 다중모달 표현을 학습합니다.
  • 이중 인코더 구조를 사용하여 이미지 특징과 텍스트 특징을 각각 처리하고, 교차 attention 메커니즘을 통해 이를 정렬합니다.
  • 표준 사전 훈련 대신 모달 간 번역에 대한 대비 학습 목표를 사용하여, 새로운 도메인에 대해 제로샷 또는 희소한 샘플로의 적응을 가능하게 합니다.
  • 한 모달리티가 누락된 경우에도 관련 표현을 생성하거나 주목할 수 있도록 하여 누락된 모달리티를 지원합니다.
  • 하이퍼파라미터는 검증 세트에서 그리드 서치를 통해 튜닝되며, 가중치 Adam과 코즈인 학습률 스케줄링을 사용합니다.
  • 모델은 언어 모델과 모달 간 번역 디코더의 초기 동결 후 종단 간 테일러닝을 수행하여 안정성을 확보합니다.

실험 결과

연구 질문

  • RQ1모든 샘플에서 이미지와 텍스트를 모두 요구하지 않고도 정치학 데이터에서 강력한 성능을 내는 시각-언어 프레임워크가 가능한가?
  • RQ2고비용 사전 훈련을 대체할 수 있는 모달 간 번역 기반 접근법이 다중모달 이해 작업에서 성능을 유지하거나 향상시킬 수 있는가?
  • RQ3MARMOT은 소셜 미디어에서 선거 사고 보고를 분류할 때 텍스트 전용 및 다중모달 베이스라인과 비교해 어떻게 성능을 냈는가?
  • RQ4MARMOT은 최신 기술 모델과 비교해 악성 멤즈 벤치마크에서 얼마나 성능을 향상시켰는가?
  • RQ5MARMOT은 모달리티가 누락되거나 불완전한 실세계 소셜 미디어 데이터에 대해 일반화 가능한가?

주요 결과

  • 2016년 미국 대선 기간의 선거 사고 트윗을 분류할 때, MARMOT는 20개 다중라벨 카테고리 중 19개에서 텍스트 전용 앙상블 분류기보다 뛰어난 성능을 보였다.
  • 악성 멤즈 데이터셋에서 MARMOT는 정확도 0.6580과 AUC 0.7587을 기록했으며, VisualBERT의 정확도(0.6473)와 AUC(0.7141)를 초월했다.
  • VisualBERT 대비 정확도에서 2.87%p, AUC에서 3.89%p 향상되어 뚜렷한 성능 향상을 보였다.
  • 모델은 안정적인 훈련 동역학을 보였으며, 초기 4 에포크 동안 파라미터 동결 후 검증 정확도가 단조롭게 증가했다.
  • MARMOT는 모달리티 누락에 뛰어난 내성성을 보였으며, 한 모달리티만 존재하는 경우에도 성능을 유지했다.
  • 대규모 이미지-캡션 데이터셋에서의 전체 사전 훈련 없이도 MARMOT는 악성 멤즈 검증 세트에서 최신 기술 수준의 성능을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.