Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Fusion: An Attention Guided Factorized Bilinear Pooling for Audio-video Emotion Recognition

Yuanyuan Zhang, Zi-Rui Wang|arXiv (Cornell University)|2019. 01. 15.
Music and Audio Processing참고 문헌 29인용 수 7
한 줄 요약

이 논문은 단일 모델 아키텍처를 사용하여 이전 최고 성능 결과를 뛰어넘는 62.48%의 정확도를 달성한, 청각-시각 정서 인식을 위한 주의력 유도 인과 분해 이중선형 풀링(FBP) 방법인 Deep Fusion을 제안한다. 이 방법은 모odal별 특징과 그들의 이중모달 상호작용을 동시에 학습한다. FBP 융합 이전에 임bedded 주의력을 적용하여 청각 및 영상 스트림 내 정서 관련 영역을 선택적으로 추출함으로써, AFEW 데이터셋에서 62.48%의 정확도를 달성한다.

ABSTRACT

Automatic emotion recognition (AER) is a challenging task due to the abstract concept and multiple expressions of emotion. Although there is no consensus on a definition, human emotional states usually can be apperceived by auditory and visual systems. Inspired by this cognitive process in human beings, it's natural to simultaneously utilize audio and visual information in AER. However, most traditional fusion approaches only build a linear paradigm, such as feature concatenation and multi-system fusion, which hardly captures complex association between audio and video. In this paper, we introduce factorized bilinear pooling (FBP) to deeply integrate the features of audio and video. Specifically, the features are selected through the embedded attention mechanism from respective modalities to obtain the emotion-related regions. The whole pipeline can be completed in a neural network. Validated on the AFEW database of the audio-video sub-challenge in EmotiW2018, the proposed approach achieves an accuracy of 62.48%, outperforming the state-of-the-art result.

연구 동기 및 목표

  • 자동 정서 인식(AER)에서 청각 및 영상 모달 간의 복잡한 비선형 상호작용을 포착하는 데 도전하는 것.
  • 선형 방법(예: 특징 연결)을 초월하여 고차원 이중모달 의존성을 모델링함으로써 융합 성능을 향상시키는 것.
  • 통합 신경망을 통해 모달별 표현과 그들의 공동 통합을 엔드 투 엔드로 학습하는 것.
  • 정서 관련 프레임과 특징을 강조하는 주의 메커니즘을 통합함으로써 모델의 강건성과 해석 가능성 향상

제안 방법

  • 이 방법은 융합 이전에 청각 및 영상 스트림 내 정서 관련 영역을 선택적으로 집중하기 위해 임베디드 주의 메커니즘을 활용한다.
  • 고차원 이중모달 상호작용을 계산하기 위해 인과 분해 이중선형 풀링(FBP)을 적용하여 표준 이중선형 풀링 대비 계산 비용을 절감한다.
  • FBP 연산은 랭크 k=4와 출력 차원 o=128을 사용하는 저랭크 분해를 통해 이중모달 상호작용을 효율적으로 모델링한다.
  • 주의, 특징 추출 및 FBP를 포함한 전체 파이프라인은 미분 가능하며 단일 신경망 내에서 엔드 투 엔드로 훈련된다.
  • FBP 레이어에서 과적합을 방지하기 위해 훈련 중 드롭아웃 비율 0.3을 적용한다.
  • 일반화 성능 향상을 위해 검증 세트를 사용하여 데이터 증강을 적용한 AFEW 데이터셋에서 모델을 훈련한다.

실험 결과

연구 질문

  • RQ1주의력 유도 특징 선택은 청각 및 영상 스트림 내 정서 관련 영역 식별에 도움이 되는가?
  • RQ2인과 분해 이중선형 풀링은 연결과 같은 선형 융합 방법보다 청각 및 영상 특징 융합에 더 효과적인가?
  • RQ3FBP와 주의 메커니즘을 포함한 통합 네트워크의 엔드 투 엔드 훈련은 청각-시각 정서 인식에서 우수한 성능을 이끌어낼 수 있는가?
  • RQ4주의 가중치는 모델이 정서적으로 민감한 프레임에 집중하는 방식을 어떻게 반영하며, 청각 신호와 일치하는가?

주요 결과

  • 제안된 Deep Fusion 모델은 AFEW 테스트 세트에서 62.48%의 정확도를 달성하여 이전 최고 성능 결과인 61.87%를 초월한다.
  • 검증 세트 데이터를 사용해 독립적으로 초기화된 네 개의 FBP 모델을 활용함으로써 성능이 62.48%로 향상되었으며, 이는 모델의 강건성과 일반화 능력을 입증한다.
  • 주의 메커니즘이 정서 관련 프레임을 효과적으로 강조하며, 청각 신호에서 정서적 발화 세그먼트(예: 웃음)와 주의 가중치 간 상관관계를 보였다.
  • 혼동 행렬은 분명히 표현된 정서(화남, 기쁨, 중립)에 대해 높은 정확도를 보였지만, 혼란스럽거나 미묘한 표현으로 인해 혐오와 놀람은 여전히 도전 과제로 남아 있다.
  • FBP 융합 전략은 단순한 특징 연결 대비 2.76% 향상된 성능을 기록하여 복잡한 이중모달 상호작용을 모델링하는 데의 효과성을 입증한다.
  • 시각화 결과는 청각 모달이 영상 주의 가중치에 영향을 미치며, 엔드 투 엔드 훈련을 통해 깊이 있는 통합 융합이 이루어지고 있음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.