Skip to main content
QUICK REVIEW

[논문 리뷰] Group Gated Fusion on Attention-based Bidirectional Alignment for Multimodal Emotion Recognition

Pengfei Liu, Kun Li|arXiv (Cornell University)|2022. 01. 17.
Emotion and Mood Recognition인용 수 9
한 줄 요약

이 논문은 주어진 감정 인식 데이터셋에서 상태의 성능을 달성하는 다중모달 감정 인식 모델인 게이트형 양방향 정렬 네트워크(Gated Bidirectional Alignment Network, GBAN)를 제안한다. GBAN은 음성과 텍스트 표현 간의 주의 기반 양방향 정렬과 새로운 그룹 게이트형 융합(GGF) 레이어를 통해 다양한 모odal의 기여도를 동적으로 가중치를 매기는 방식을 사용한다. GBAN은 IEMOCAP 데이터셋에서 72.39%의 가중 정확도로 기존 방법들을 능가하는 최신 기술 수준의 성능을 기록한다.

ABSTRACT

Emotion recognition is a challenging and actively-studied research area that plays a critical role in emotion-aware human-computer interaction systems. In a multimodal setting, temporal alignment between different modalities has not been well investigated yet. This paper presents a new model named as Gated Bidirectional Alignment Network (GBAN), which consists of an attention-based bidirectional alignment network over LSTM hidden states to explicitly capture the alignment relationship between speech and text, and a novel group gated fusion (GGF) layer to integrate the representations of different modalities. We empirically show that the attention-aligned representations outperform the last-hidden-states of LSTM significantly, and the proposed GBAN model outperforms existing state-of-the-art multimodal approaches on the IEMOCAP dataset.

연구 동기 및 목표

  • 다중모달 감정 인식에서 음성과 텍스트 간의 시간적 정렬을 명시적으로 모델링하지 않은 점을 해결하기 위해.
  • 음성과 텍스트 시퀀스 간의 상호의존성을 캡처하여 표현 학습을 향상시키기 위해.
  • 다양한 모달의 기여도를 동적으로 가중치를 매기는 보다 효과적이고 해석 가능한 융합 기법을 개발하기 위해.
  • 기존 최신 기술 수준의 모델들을 초월하여 IEMOCAP 벤치마크에서 다중모달 감정 인식 성능을 향상시키기 위해.

제안 방법

  • 음성과 텍스트 모달리티에서 계층적 표현을 추출하기 위해 별도의 CNN-LSTM 인코더를 사용한다.
  • 음성에서 텍스트로, 그리고 텍스트에서 음성으로의 주의 기반 양방향 정렬 네트워크를 적용하여 다중모달 간의 종속성을 학습한다.
  • 그룹화된 표현(예: 주의 출력 및 은닉 상태)에 시그모이드 게이트를 적용하여 모달별 가중치를 계산하는 그룹 게이트형 융합(GGF) 레이어를 도입한다.
  • 학습 가능한 게이팅 메커니즘을 적용하여 감정 분류 과정에서 각 모달의 중요도를 자동으로 결정할 수 있도록 한다.
  • GGF 레이어를 음성과 텍스트의 주의 출력(a_s, a_t)과 그에 해당하는 LSTM 은닉 상태(h_s, h_t)의 네 가지 입력 표현에 적용한다.
  • IEMOCAP 데이터셋에서 5겹 교차검증을 사용하여 전체 모델을 엔드 투 엔드로 훈련한다.

실험 결과

연구 질문

  • RQ1음성과 텍스트 간의 양방향 주의 정렬이 단방향 또는 정렬 없이 사용하는 경우보다 더 분류에 유용한 표현을 제공하는가?
  • RQ2그룹 게이트형 융합 기법이 연결 또는 텐서 융합과 비교해 효과적이고 해석 가능한 방식으로 다중모달 표현을 통합할 수 있는가?
  • RQ3다중모달 환경에서 다양한 감정 카테고리에 따라 음성과 텍스트 모달의 기여도는 어떻게 변화하는가?
  • RQ4제안된 GBAN 모델이 기존의 다중모달 감정 인식 접근법과 비교해 IEMOCAP 벤치마크에서 최신 기술 수준의 성능을 달성하는가?

주요 결과

  • 제안된 주의 기반 양방향 정렬 네트워크가 표현 품질을 크게 향상시켜, 마지막 LSTM 은닉 상태만을 사용하는 모델보다 뛰어난 성능을 기록한다.
  • 그룹 게이트형 융합(GGF) 레이어는 모든 융합 방법 중에서 가장 높은 성능을 기록했으며, IEMOCAP 데이터셋에서 72.39%의 가중 정확도를 달성했다.
  • 텍스트 모달 표현(a_t 및 h_t)이 음성 표현(a_s 및 h_s)보다 항상 더 높은 융합 가중치를 확보하여, 감정 인식에서 더 높은 분류 능력을 지닌다는 것을 시사한다.
  • BiAtt-TFL 및 BiAtt-GMU와 같은 기존 최신 기술 수준의 모델들을 초월하여 GBAN은 IEMOCAP에서 72.39%의 가중 정확도와 70.08%의 무게 없는 정확도로 성능을 기록했다.
  • GGF 레이어는 각 예측에 대해 어떤 모달이 가장 영향을 미치는지 분석할 수 있도록 해석 가능한 모달 기여도 가중치를 제공한다.
  • IEMOCAP처럼 작은 데이터셋에서도 GGF 기법은 간단한 연결 기반 융합보다 뛰어난 성능을 보이며, 이는 그 기법의 강건성과 표현 능력을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.