Skip to main content
QUICK REVIEW

[논문 리뷰] Integrating Multimodal Information in Large Pretrained Transformers

Wasifur Rahman, Md. Kamrul Hasan|arXiv (Cornell University)|2019. 08. 15.
Topic Modeling참고 문헌 28인용 수 9
한 줄 요약

이 논문은 BERT와 XLNet의 핵심 아키텍처를 수정하지 않고도 피인코딩 및 청각 모odal을 파인튜닝 중에 통합할 수 있도록 해주는 경량 모듈인 다중모odal 적응 게이트(Multimodal Adaptation Gate, MAG)를 제안한다. MAG는 비언어적 신호에 기반해 모델의 내부 표현을 다이나믹하게 조정함으로써, 다중모달 감성 분석에서 최고 성능을 기록하며, 특히 CMU-MOSI에서 인간 수준의 성능을 달성한 MAG-XLNet을 구현한다.

ABSTRACT

Recent Transformer-based contextual word representations, including BERT and XLNet, have shown state-of-the-art performance in multiple disciplines within NLP. Fine-tuning the trained contextual models on task-specific datasets has been the key to achieving superior performance downstream. While fine-tuning these pre-trained models is straightforward for lexical applications (applications with only language modality), it is not trivial for multimodal language (a growing area in NLP focused on modeling face-to-face communication). Pre-trained models don't have the necessary components to accept two extra modalities of vision and acoustic. In this paper, we proposed an attachment to BERT and XLNet called Multimodal Adaptation Gate (MAG). MAG allows BERT and XLNet to accept multimodal nonverbal data during fine-tuning. It does so by generating a shift to internal representation of BERT and XLNet; a shift that is conditioned on the visual and acoustic modalities. In our experiments, we study the commonly used CMU-MOSI and CMU-MOSEI datasets for multimodal sentiment analysis. Fine-tuning MAG-BERT and MAG-XLNet significantly boosts the sentiment analysis performance over previous baselines as well as language-only fine-tuning of BERT and XLNet. On the CMU-MOSI dataset, MAG-XLNet achieves human-level multimodal sentiment analysis performance for the first time in the NLP community.

연구 동기 및 목표

  • BERT 및 XLNet과 같은 대규모 사전 훈련된 트랜스포머 모델이 다중모달 언어 작업을 위한 파인튜닝 중에 시각적 및 청각적 모달을 효과적으로 통합할 수 있도록 하는 것.
  • 아키텍처 변경 없이 언어 전용 사전 훈련된 모델을 다중모달 입력에 적응시키는 도전 과제를 해결하는 것.
  • 사전 훈련된 모델의 아키텍처를 유지하면서도 다중모달 적응을 가능하게 하는 최소화되고 효율적이며 효과적인 융합 메커니즘을 개발하는 것.
  • 특히 CMU-MOSI 및 CMU-MOSEI에서 다중모달 감성 분석 벤치마크에서 열등한 성능을 내는 것.
  • MAG를 사용한 파인튜닝이 언어 전용 파인튜닝 및 외부 융합 방법에 비해 상당한 성능 향상을 이끌어내는지 입증하는 것.

제안 방법

  • 비언어적 신호에 기반해 시각적 및 청각적 특징에서 조건부 적응 벡터를 생성하는 학습 가능한 모듈인 다중모달 적응 게이트(Multimodal Adaptation Gate, MAG)를 도입한다.
  • MAG는 다중헤드 어텐션 메커니즘을 사용하여 시각적 및 청각적 특징의 가중 융합을 계산함으로써 비언어 신호에 조건화된 이동 벡터를 생성한다.
  • 적응 벡터는 잔차 스타일 업데이트를 통해 BERT 또는 XLNet의 히든 상태에 적용되어 모델의 원래 아키텍처를 변경하지 않은 채 내부 표현을 수정한다.
  • 이 방법은 파인튜닝 중에 적용되며, 사전 훈련된 모델이 사전 훈련된 지식을 유지하면서도 다중모달 입력에 적응할 수 있도록 한다.
  • 적응 벡터는 시각 및 청각 인코더의 후단 특징에서 계산되며, 고차원의 추상적 비언어 표현을 사용함으로써 정확성을 높인다.
  • 이 프레임워크는 엔드 투 엔드로 훈련 가능하며, 표준 파인튜닝과 동일한 계산 복잡도를 유지하며 최소한의 파라미터 오버헤드를 갖는다.

실험 결과

연구 질문

  • RQ1BERT와 XLNet은 아키텍처 수정 없이도 시각적 및 청각적 모달을 효과적으로 통합할 수 있는가?
  • RQ2제안된 다중모달 적응 게이트(MAG)는 언어 전용 파인튜닝 및 외부 융합 방법에 비해 다중모달 감성 분석 성능을 향상시키는가?
  • RQ3MAG는 CMU-MOSI와 같은 다중모달 감성 분석 벤치마크에서 인간 수준의 성능을 달성할 수 있는가?
  • RQ4MAG 프레임워크는 CMU-MOSEI와 같이 다른 애너테이션 수준을 가진 다른 다중모달 데이터셋으로 일반화되는가?
  • RQ5성능 향상은 MAG 메커니즘 자체의 기여 때문인가, 아니면 사전 훈련된 모델 아키텍처의 영향 때문인가?

주요 결과

  • MAG-XLNet은 CMU-MOSI 데이터셋에서 최고 성능을 기록하며, 자연어처리 분야에서 처음으로 인간 수준의 정확도를 달성했다.
  • CMU-MOSI에서 MAG-BERT와 MAG-XLNet은 BERT 및 XLNet의 언어 전용 파인튜닝과 MulT와 같은 외부 융합 기반 모델보다 유의미하게 뛰어난 성능을 보였다.
  • CMU-MOSEI에서 MAG-BERT는 이진 정확도 84.7%와 F1 스코어 84.5%를 기록했으며, MulT(83.5%, 82.9%)와 표준 BERT(83.9%, 83.9%)를 초월했다.
  • CMU-MOSEI에서 MAG-XLNet은 이진 정확도 85.6%와 F1 스코어 85.7%를 기록했으며, MulT(84.1%, 83.7%)와 표준 XLNet(85.4%, 85.2%)를 모두 능가했다.
  • 절단 실험 결과, MAG 프레임워크 내에서 BERT와 XLNet의 무작위 초기화는 열악한 성능(70.1% 및 70.7% BA, CMU-MOSI 기준)을 보였으며, 이는 성능 향상이 MAG를 통한 성공적인 파인튜닝에 기인함을 확인한다.
  • 정성적 분석 결과, MAG-XLNet이 얼굴 표정과 음성 톤과 같은 비언어적 신호를 통합하여 감성 강도를 정확히 조정함으로써 텍스트 감성 예측을 뒤집거나 강화함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.