Skip to main content
QUICK REVIEW

[논문 리뷰] Predicting emotion from music videos: exploring the relative contribution of visual and auditory information to affective responses

Phoebe Chua, Dimos Makris|arXiv (Cornell University)|2022. 02. 19.
Music and Audio Processing인용 수 7
한 줄 요약

이 논문은 청각, 시각, 청각시각 병합 조건에서의 정서(긍정성 및 각성)에 대해 주석 처리된 음악 비디오 데이터셋 MuVi를 소개한다. 또한 PAIR라는 전이 학습 아키텍처를 제안하여 고립된 모odal 평가를 활용해 다모달 정서 예측 성능을 향상시키며, 청각 정보가 주로 각성 인식을 이끌고 있으며, 두 모달이 모두 긍정성 인식에 영향을 준다는 것을 발견한다.

ABSTRACT

Although media content is increasingly produced, distributed, and consumed in multiple combinations of modalities, how individual modalities contribute to the perceived emotion of a media item remains poorly understood. In this paper we present MusicVideos (MuVi), a novel dataset for affective multimedia content analysis to study how the auditory and visual modalities contribute to the perceived emotion of media. The data were collected by presenting music videos to participants in three conditions: music, visual, and audiovisual. Participants annotated the music videos for valence and arousal over time, as well as the overall emotion conveyed. We present detailed descriptive statistics for key measures in the dataset and the results of feature importance analyses for each condition. Finally, we propose a novel transfer learning architecture to train Predictive models Augmented with Isolated modality Ratings (PAIR) and demonstrate the potential of isolated modality ratings for enhancing multimodal emotion recognition. Our results suggest that perceptions of arousal are influenced primarily by auditory information, while perceptions of valence are more subjective and can be influenced by both visual and auditory information. The dataset is made publicly available.

연구 동기 및 목표

  • 음악 비디오에서 청각 및 시각 모달이 독립적이고 통합적으로 정서 인식에 어떻게 기여하는지 조사하기 위해.
  • 고립된 모달과 병합된 모달에서 차원적(긍정성/각성) 및 이산 정서 주석을 캡처하는 데이터셋을 개발하기 위해.
  • 고립된 모달 평가를 보조 지도로 활용하여 다모달 정서 인식 성능을 향상시키는 새로운 아키텍처 PAIR를 설계하기 위해.
  • 성별, 음악 교육 경력, 곡에 대한 익숙함과 같은 인구통계적 요인이 정서 인식에 미치는 영향을 분석하기 위해.
  • 시간적 시리즈 정서 예측에 유용한 시각적 맥락 특징(장면, 물체, 동작)의 활용 가능성을 탐색하기 위해.

제안 방법

  • 음악 비디오를 수집하고, 원본 청각시각 조건, 청각 전용(음악), 시각 전용(음성 제거) 조건에서 참가자들이 시간에 따라 긍정성 및 각성에 주석을 달았다.
  • 성별, 곡에 대한 익숙함, 음악 교육 경력 등 참가자 메타데이터를 확보하여 정서 인식에 대한 인구통계적 영향을 분석하였다.
  • 기울기 기반 방법을 사용한 기능 중요도 분석을 수행하여 정서 예측에 기여하는 주요 청각 및 시각 기능을 규명하였다.
  • 청각시각 데이터와 고립된 모달 평가를 함께 학습하여 일반화 성능을 향상시키는 전이 학습 프레임워크인 PAIR(예측 모델에 고립된 모달 평가를 보조 지도로 통합)를 제안하였다.
  • 장기 순환 신경망(LSTM)을 사용하여 다모달 융합 전략을 적용하고, 연속적인 긍정성 및 각성 점수를 예측하기 위해 모델을 훈련하고 평가하였다.
  • 정서 주석의 일致성 검증을 위해 평가자 간 일致성(ICC) 및 상관 분석을 사용하였다.

실험 결과

연구 질문

  • RQ1고립된 청각 및 시각 모달이 음악 비디오에서 인식된 각성과 긍정성에 어떻게 다르게 기여하는가?
  • RQ2성별, 음악 교육 경력, 곡에 대한 익숙함과 같은 인구통계적 요인이 음악 비디오의 정서 인식에 어느 정도 영향을 미치는가?
  • RQ3장면, 물체, 동작 중 어떤 시각적 특징이 정서 인식에 가장 많은 영향을 미치는가?
  • RQ4고립된 모달 평가가 다모달 정서 인식 모델의 성능 향상에 기여할 수 있는가?
  • RQ5다모달 정서 인식에서 시각 또는 청각의 지배성이 어떤 조건에서 나타나는가?

주요 결과

  • 청각 정보가 인식된 각성의 대부분의 분산을 설명하며, 음악 비디오에서 각성 인식의 주요 원인이 청각 정보임을 시사한다.
  • 청각 및 시각 모달 모두 긍정성 인식에 기여하며, 특히 시각 콘텐츠가 주관적 긍정성 판단을 형성하는 데 중요한 역할을 한다.
  • 시각 모달은 긍정성에 대해 가장 높은 평가자 간 일致성을 보였지만, 각성에 대해서는 가장 낮은 일致성을 보였으며, 이는 침묵한 비디오를 볼 때 긍정성 인식에 더 큰 공감대가 형성됨을 시사한다.
  • 고립된 모달 평가 분석 결과, 음악 전용 조건에 비해 시각 콘텐츠를 추가하면 일반적으로 인식된 각성과 긍정성이 감소하는 경향을 보였다.
  • 기능 중요도 분석 결과, 동작과 관련된 시각적 기능이 정서 인식에 특히 유용한 반면, 장면 기반 특징은 고정된 시간 윈도우보다 시간적 모델링에 더 적합하다는 것을 확인하였다.
  • 고립된 모달 평가를 통합한 PAIR 모델은 다모달 정서 예측에서 향상된 성능을 보였으며, 보조 모달 지도의 가치를 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.