Skip to main content
QUICK REVIEW

[논문 리뷰] GLA in MediaEval 2018 Emotional Impact of Movies Task

Jennifer J. Sun, Ting Liu|arXiv (Cornell University)|2019. 11. 27.
Generative Adversarial Networks and Image Synthesis참고 문헌 7인용 수 4
한 줄 요약

이 논문은 영상, 음성, 얼굴 모odal에서 사전 훈련된 특징을 사용하여 영화의 연속적인 밸런스와 각도를 예측하기 위한 다중모달 딥러닝 접근법을 제시한다. GRU 기반의 시계열 모델링과 믹스처 오브 은닉자 회귀 헤드, 버터워스 필터링을 활용하여, 이 방법은 MediaEval 2018 평가 지표 중 세 가지에서 최고 성능을 기록했으며, 밸런스와 각도에 대해 가장 낮은 MSE와 각도에 대해 가장 높은 PCC를 기록했다.

ABSTRACT

The visual and audio information from movies can evoke a variety of emotions in viewers. Towards a better understanding of viewer impact, we present our methods for the MediaEval 2018 Emotional Impact of Movies Task to predict the expected valence and arousal continuously in movies. This task, using the LIRIS-ACCEDE dataset, enables researchers to compare different approaches for predicting viewer impact from movies. Our approach leverages image, audio, and face based features computed using pre-trained neural networks. These features were computed over time and modeled using a gated recurrent unit (GRU) based network followed by a mixture of experts model to compute multiclass predictions. We smoothed these predictions using a Butterworth filter for our final result. Our method enabled us to achieve top performance in three evaluation metrics in the MediaEval 2018 task.

연구 동기 및 목표

  • 시각적, 음성적, 얼굴적 특징를 기반으로 영화의 연속적인 밸런스와 각도 수준을 예측하기 위해.
  • 전이 학습과 다중모달 융합을 통해 정서 예측 성능을 향상시키기 위해.
  • 재귀적 시퀀스 모델링을 통해 정서적 영향의 시계열 역학을 다루기 위해.
  • 후처리 필터링 기법을 사용하여 예측의 부드러움과 정확도를 향상시키기 위해.
  • MediaEval 2018 영화 정서적 영향 과제에서 LIRIS-ACCEDE 데이터셋에서 최신 기술 수준의 성과를 달성하기 위해.

제안 방법

  • ImageNet에서 사전 훈련된 Inception 네트워크를 사용하여 영상 특징를 추출하였다 (Inception-Image).
  • YouTube-8M에서 사전 훈련된 VGG 기반 모델인 AudioSet을 사용하여 음성 특징를 추출하였다 (AudioSet).
  • 얼굴 데이터에서 훈련된 Inception 기반 모델을 사용하여 얼굴 특징를 추출하였다 (Inception-Face), 프레임당 가장 큰 두 개의 얼굴에 집중하였다.
  • 모달별 특징를 후기 융합하여 시계열 의존성을 모델링하기 위해 GRU 기반의 재귀 네트워크를 통과시켰다.
  • 밸런스와 각도의 다변량 회귀를 위해 소프트맥스 게이팅 네트워크를 갖춘 믹스처 오브 은닉자 모델을 사용하였다.
  • 예측 결과의 고주파 변동을 부드럽게 하기 위해 버터워스 저역통과 필터를 적용하였다.

실험 결과

연구 질문

  • RQ1사전 훈련된 영상, 음성, 얼굴 특징는 VGG16 + openSMILE와 같은 기준 특징보다 정서적 영향 예측에 얼마나 우수한가?
  • RQ2영화 정서 반응의 시계열 역학을 모델링하기 위한 최적의 시퀀스 길이는 무엇인가?
  • RQ3재귀 아키텍처 선택(예: GRU 대비 LSTM 또는 TCN)이 연속 정서 예측 성능에 어떤 영향을 미치는가?
  • RQ4앙상블 평균화와 배치 정규화는 예측의 강인성과 일반화 능력을 얼마나 향상시키는가?
  • RQ5버터워스 필터를 사용한 후처리가 관련성을 떨어뜨리지 않고 예측 출력의 노이즈를 효과적으로 줄일 수 있는가?

주요 결과

  • 모델은 모든 제출 중에서 밸런스에 대해 가장 낮은 평균 제곱 오차(MSE) 0.0837을 기록했으며, 각도에 대해 가장 높은 피어슨 상관계수(PCC) 0.3513를 기록했다.
  • Inception-Face 특징를 통합함으로써 성능 향상이 뚜렷하게 나타났으며, 이는 얼굴 정보가 정서 예측에 매우 유용하다는 것을 시사한다.
  • GRU 기반 모델이 LSTMs와 TCNs를 모두 초월했으며, 60초 입력 시퀀스가 더 짧은 시퀀스보다 더 좋은 성능을 냈다.
  • 다섯 번의 실행에 걸친 앙상블 평균화로 최고 단일 실행 대비 MSE가 30% 감소하여 분산 감소의 이점을 입증했다.
  • 추론 중 배치 정규화는 특히 각도 예측에 대해 분산을 증가시켰으며, 이는 훈련 및 테스트 세트 간의 분포 이탈 때문일 가능성이 높다.
  • 버터워스 필터는 이동 평균 필터보다 더 우수한 성능을 보였으며, 통과대역의 평탄함을 유지함으로써 더 매끄럽고 정확한 예측을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.