Skip to main content
QUICK REVIEW

[논문 리뷰] MuSe 2020 -- The First International Multimodal Sentiment Analysis in Real-life Media Challenge and Workshop

Lukas Stappen, Alice Baird|arXiv (Cornell University)|2020. 04. 30.
Sentiment Analysis and Opinion Mining참고 문헌 52인용 수 5
한 줄 요약

MuSe 2020은 실제 생활 영상에서 다중모odal 정서 분석을 위한 첫 번째 국제 챌린지를 소개하며, 실제 차량 리뷰 영상으로 구성된 MuSe-CaR 데이터셋을 사용하여 세 가지 하위 챌린지—지속적 정서 예측(MuSe-Wild), 정서-대상 참여도 탐지(MuSe-Topic), 신뢰성 예측(MuSe-Trust)을 평가한다. 본 연구는 음성, 시각, 텍스트 특징의 다중모달 융합을 통해 최신 기준 성능을 수립하였으며, 주요 결과로는 원시 음성 특징이 정서 예측에서 가장 우수한 성능을 보였고, 정서의 평형성과 각성도 신호를 통합할 경우 신뢰성 예측 성능이 향상됨을 확인하였다.

ABSTRACT

Multimodal Sentiment Analysis in Real-life Media (MuSe) 2020 is a Challenge-based Workshop focusing on the tasks of sentiment recognition, as well as emotion-target engagement and trustworthiness detection by means of more comprehensively integrating the audio-visual and language modalities. The purpose of MuSe 2020 is to bring together communities from different disciplines; mainly, the audio-visual emotion recognition community (signal-based), and the sentiment analysis community (symbol-based). We present three distinct sub-challenges: MuSe-Wild, which focuses on continuous emotion (arousal and valence) prediction; MuSe-Topic, in which participants recognise domain-specific topics as the target of 3-class (low, medium, high) emotions; and MuSe-Trust, in which the novel aspect of trustworthiness is to be predicted. In this paper, we provide detailed information on MuSe-CaR, the first of its kind in-the-wild database, which is utilised for the challenge, as well as the state-of-the-art features and modelling approaches applied. For each sub-challenge, a competitive baseline for participants is set; namely, on test we report for MuSe-Wild a combined (valence and arousal) CCC of .2568, for MuSe-Topic a score (computed as 0.34$\cdot$ UAR + 0.66$\cdot$F1) of 76.78 % on the 10-class topic and 40.64 % on the 3-class emotion prediction, and for MuSe-Trust a CCC of .4359.

연구 동기 및 목표

  • 신호 기반 음성-시각 정서 인식 공동체와 상징 기반 정서 분석 공동체 간 격차를 해소하기 위해 실제 환경에서 다중모달 융합을 촉진하기 위해.
  • 사용자 생성의 실생활 영상에서 지속적 정서(평형성과 각성도) 예측, 정서-대상 참여도, 신뢰성 탐지에 대한 다중모달 접근법을 평가하고 비교하기 위해.
  • 대규모 실생활 다중모달 코퍼스인 차량 리뷰 데이터셋인 MuSe-CaR를 기반으로 기준 성능을 수립하여 다양한 모odal 간 투명하고 재현 가능한 평가를 가능하게 하기 위해.
  • 자연주의 환경에서 정서 컴퓨팅을 위한 언어, 음성, 시각 신호를 통합하는 통합형 다중모달 모델의 개발을 촉진하기 위해.
  • 재현 가능성과 공정한 비교를 위해 오픈소스 특징, 코드, 데이터를 제공함으로써 다중모달 융합 기법의 혁신을 장려하기 위해.

제안 방법

  • 이 챌린지는 35시간 분량의 실생활 차량 리뷰 영상 콜렉션으로 구성된 MuSe-CaR 데이터셋을 사용하며, 평형성, 각성도, 주제, 신뢰성에 대한 다중모달 주석이 포함되어 있다.
  • MuSe-Wild의 경우, 원시 음성 특징, 안면 랜드마크(dlib), 텍스트 임베딩(FastText, BERT)에서 유도된 특징을 사용하여 지속적 평형성과 각성도를 예측한다.
  • MuSe-Topic의 경우, 텍스트(BERT), 음성(eGeMAPS), 시각(Xception, VGGface) 특징의 다중모달 융합을 통해 10개의 도메인 특화 주제와 3단계 정서 강도(낮음/중간/높음)를 분류한다.
  • MuSe-Trust의 경우, 다중모달 특징을 사용하여 지속적 신뢰성 예측을 수행하며, 별도의 분석을 통해 평형성과 각성도 예측을 보조 신호로 추가했을 때의 영향을 평가한다.
  • 기준 성능 시스템은 후기 융합 또는 조기 융합 전략을 사용한 엔드 투 엔드 학습을 적용하며, 최고 성능을 보인 모델은 FastText, VGGface, 원시 음성 특징을 조합하여 최적의 성능을 달성한다.
  • 모든 기준 성능 시스템은 오픈소스 도구를 사용해 구현되었으며, 학습, 개발, 테스트 세트가 공개되어 재현성과 투명성을 확보하였다.

실험 결과

연구 질문

  • RQ1실생활 사용자 생성 영상 콘텐츠에서 다중모달 모델이 지속적 평형성과 각성도를 얼마나 잘 예측할 수 있는가?
  • RQ2자연스러운 대화에서 특정 주제에 대해 다중모달 융합이 정서-대상 참여도 탐지에 얼마나 기여하는가?
  • RQ3평형성과 각성도 예측을 포함함으로써 다중모달 시스템의 신뢰성 추정 성능이 향상되는가?
  • RQ4통제되지 않은 실생활 환경에서 정서 예측에 있어 어떤 모odal(텍스트, 음성, 시각)이 가장 기여도가 높은가?
  • RQ5최신 딥러닝 아키텍처(BERT, Xception, VGGface)가 수작업 특징(eGeMAPS)과 결합되었을 때 다중모달 정서 분석에서 얼마나 효과적인가?

주요 결과

  • MuSe-Wild의 엔드 투 엔드 기준 성능은 테스트 세트에서 평형성과 각성도 예측에 대해 종합 Concordance Correlation Coefficient(CCC)가 0.2568을 기록하였다.
  • MuSe-Topic의 경우, 최고 기준 성능는 10개 클래스 주제 예측에서 76.78%의 종합 점수(0.34×UAR + 0.66×F1)와 3개 클래스 정서 강도 예측에서 40.64%의 성능을 달성하였다.
  • MuSe-Trust의 기준 성능은 테스트 세트에서 CCC가 0.4359를 기록하였으며, 평형성과 각성도 신호를 보조 입력으로 추가했을 경우 성능이 0.4119로 향상되었다.
  • 지속적 정서 예측에서 원시 음성 특징이 시각적 및 텍스트적 특징과 단독으로 비교했을 때 가장 뛰어난 성능을 보였다.
  • 주제 탐지의 경우, NLP 전용 모델인 미세조정된 BERT(Albert)가 다른 아키텍처를 압도적으로 뛰어나, 주제 인식에서 언어 모델링의 우세성을 보여주었다.
  • 평형성과 각성도 예측을 보조 신호로 통합함으로써 신뢰성 추정 성능이 향상되었으며, 이는 다중모달 정서 컴퓨팅에서 다중 과제 지식 전이의 가치를 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.