Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-modal Sentiment Analysis using Deep Canonical Correlation Analysis

Zhongkai Sun, Prathusha K Sarma|arXiv (Cornell University)|2019. 07. 15.
Sentiment Analysis and Opinion Mining참고 문헌 18인용 수 10
한 줄 요약

이 논문은 감성 분류 성능 향상을 위해 텍스트, 오디오, 비디오 특징을 공동으로 임bedding하는 데 Deep Canonical Correlation Analysis (DCCA)를 사용하는 다중모달 감성 분석 프레임워크를 제안한다. BERT를 사용해 고품질의 텍스트 인코딩을 수행하고, One-Step 및 Two-Step DCCA를 적용해 상관 관계를 가지는 표현을 학습함으로써, CMU-MOSI, CMU-MOSEI 및 새로운 Debate Emotion 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성한다. 이는 BERT의 뛰어난 특징 학습 능력으로 인해 텍스트가 가장 크게 기여하기 때문이다.

ABSTRACT

This paper learns multi-modal embeddings from text, audio, and video views/modes of data in order to improve upon down-stream sentiment classification. The experimental framework also allows investigation of the relative contributions of the individual views in the final multi-modal embedding. Individual features derived from the three views are combined into a multi-modal embedding using Deep Canonical Correlation Analysis (DCCA) in two ways i) One-Step DCCA and ii) Two-Step DCCA. This paper learns text embeddings using BERT, the current state-of-the-art in text encoders. We posit that this highly optimized algorithm dominates over the contribution of other views, though each view does contribute to the final result. Classification tasks are carried out on two benchmark datasets and on a new Debate Emotion data set, and together these demonstrate that the one-Step DCCA outperforms the current state-of-the-art in learning multi-modal embeddings.

연구 동기 및 목표

  • 텍스트, 오디오, 비디오에서의 공동 표현을 깊이 있는 캐논리컬 상관 분석을 통해 학습하여 다중모달 감성 분류 성능을 향상시키는 것.
  • 최종 감성 분류 성능에 있어 각 모달 — 텍스트, 오디오, 비디오 — 의 기여도를 조사하는 것.
  • One-Step 및 Two-Step DCCA 프레임워크가 감성 분석을 위한 다중모달 특징 융합에 얼마나 효과적인지 평가하는 것.
  • 다중모달 학습에서 미세조정 없이도 사전 훈련된 BERT를 고정된 인코더로 사용할 수 있음을 보여주는 것.
  • 기존 벤치마크 데이터셋 외에 새로운 Debate Emotion 데이터셋을 도입하고 평가하는 것.

제안 방법

  • 텍스트, 오디오, 비디오 모달 간 비선형적이고 상관 관계가 있는 표현을 학습하기 위해 Deep Canonical Correlation Analysis (DCCA)를 사용한다.
  • 텍스트의 고차원적이고 맥락 인식 가능한 임베딩을 추출하기 위해 미세조정 없이도 고정된 인코더로 BERT를 사용한다.
  • Two-Step DCCA를 적용하여 먼저 오디오와 비디오 간의 상관관계를 학습한 후, 그 결과를 텍스트 임베딩과 결합한다.
  • One-Step DCCA를 사용해 모든 세 모달을 한 번의 최적화 단계에서 동시에 상관 관계 있는 표현을 학습한다.
  • BiLSTM, 3D-CNN, openSMILE을 사용해 오디오 및 비디오 특징을 추출하고, BERT는 텍스트 특징을 제공한다.
  • 모든 모달을 DCCA를 통해 융합하여 시각 간의 캐논리컬 상관관계를 최대화하고, 상관관계가 없는 노이즈를 걸러낸다.

실험 결과

연구 질문

  • RQ1텍스트, 오디오, 비디오 모달을 통합함으로써 단모달 접근 방식에 비해 감성 분류 정확도가 얼마나 향상되는가?
  • RQ2최종 다중모달 감성 분류 성능에 있어 각 모달 — 텍스트, 오디오, 비디오 — 의 기여도는 어느 정도인가?
  • RQ3순차적으로 모달을 처리하는 Two-Step DCCA 접근 방식이 모든 모달을 동시에 융합하는 One-Step DCCA 방법보다 성능이 뛰어나게 되는가?
  • RQ4사전 훈련된 BERT를 고정된 텍스트 인코더로 사용할 경우, 다중모달 감성 분석 성능 향상에 어느 정도 기여하는가?
  • RQ5제안된 DCCA 기반 융합 방법은 기존 최신 기술 수준의 벤치마크 및 신규 데이터셋에서 어떻게 비교되는가?

주요 결과

  • One-Step DCCA 방법은 CMU-MOSI, CMU-MOSEI 및 Debate Emotion 데이터셋에서 기존 최신 기술 수준(SOTA) 방법을 초월하여 MOSI에서 92.05%의 정확도, MOSEI에서 91.34%의 정확도를 달성한다.
  • DCCA 프레임워크에서 텍스트, 오디오, 비디오 세 모달을 모두 사용할 경우 가장 높은 분류 정확도를 기록하여 다중모달 융합의 유용성을 확인한다.
  • Two-Step DCCA 접근 방식은 오디오와 비디오를 먼저 상관관계를 학습한 후 텍스트와 융합하는 방식으로, MOSEI에서 91.34%의 정확도, Debate Emotion에서 83.33%의 F1 스코어를 기록하여 One-Step DCCA와 유사한 성능을 보였다.
  • BERT에서 유도된 텍스트 임베딩이 최종 표현을 지배하며, 이는 텍스트가 포함될 경우 항상 성능 향상이 발생함으로써 뚜렷하게 드러난다. 비록 오디오와 비디오도 의미 있는 기여를 하지만 말이다.
  • 텍스트와 다른 모달 간의 성능 격차는 BERT가 대규모 텍스트 데이터에서 우수하게 최적화되어 있기 때문일 것이며, 이는 오디오 및 비디오 특징 추출 방법이 아직 개발이 덜 되어 있음을 시사한다.
  • 융합 전략(One-Step 대 Two-Step)과 모달 순서의 선택이 성능에 상당한 영향을 미치며, 오디오-비디오 상관관계를 먼저 학습한 후 텍스트 통합을 수행할 경우 가장 우수한 성능을 기록한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.