Skip to main content
QUICK REVIEW

[논문 리뷰] GraphCFC: A Directed Graph Based Cross-Modal Feature Complementation Approach for Multimodal Conversational Emotion Recognition

Jiang Li, Xiaoping Wang|arXiv (Cornell University)|2022. 07. 06.
Sentiment Analysis and Opinion Mining참고 문헌 41인용 수 9
한 줄 요약

이 논문은 다중모态 대화 감정 인식에서 장거리 문맥적 의존성과 이질적 모달 간 상호작용을 모델링하기 위해 다중 하위공간 추출기와 쌍별 다중모달 보완 전략(PairCC)을 갖춘 GNN를 사용하는 방향성 그래프 기반의 다중모달 특징 보완 프레임워크인 GraphCFC를 제안한다. IEMOCAP 및 MELD 데이터셋에서 최신 기술(SOTA) 성능을 달성하였으며, 3개 감정 분류 설정에서 MELD에서 정확도 0.61% 및 F1 점수 1.20% 향상으로 MMGCN을 능가한다.

ABSTRACT

Emotion Recognition in Conversation (ERC) plays a significant part in Human-Computer Interaction (HCI) systems since it can provide empathetic services. Multimodal ERC can mitigate the drawbacks of uni-modal approaches. Recently, Graph Neural Networks (GNNs) have been widely used in a variety of fields due to their superior performance in relation modeling. In multimodal ERC, GNNs are capable of extracting both long-distance contextual information and inter-modal interactive information. Unfortunately, since existing methods such as MMGCN directly fuse multiple modalities, redundant information may be generated and diverse information may be lost. In this work, we present a directed Graph based Cross-modal Feature Complementation (GraphCFC) module that can efficiently model contextual and interactive information. GraphCFC alleviates the problem of heterogeneity gap in multimodal fusion by utilizing multiple subspace extractors and Pair-wise Cross-modal Complementary (PairCC) strategy. We extract various types of edges from the constructed graph for encoding, thus enabling GNNs to extract crucial contextual and interactive information more accurately when performing message passing. Furthermore, we design a GNN structure called GAT-MLP, which can provide a new unified network framework for multimodal learning. The experimental results on two benchmark datasets show that our GraphCFC outperforms the state-of-the-art (SOTA) approaches.

연구 동기 및 목표

  • 다중모달 대화 감정 인식(ERC)에서 단모달 및 직접 융합 기반 접근법의 한계, 특히 다양한 정보 손실과 특징 융합 시의 중복 문제를 해결하기 위해.
  • 텍스트, 음성, 시각적 입력 간의 모달 이질성 격차를 줄이기 위해 동적이고 상호보완적인 특징 학습을 가능하게 하여 다중모달 융합에서의 이질성 감소를 위해.
  • 기존의 GNN 기반 방법(예: MMGCN)보다 장거리 문맥적 의존성과 이질적 모달 간 상호작용을 더 효과적으로 모델링하기 위해.
  • 대화 시스템에서 강력한 다중모달 표현 학습을 지원하는 통합된 GNN 아키텍처인 GAT-MLP를 설계하기 위해.
  • 감정 이동 문제를 완화하고 미묘하거나 모호한 감정 상태를 더 잘 인식함으로써 기준 데이터셋에서의 성능 향상 달성하기 위해.

제안 방법

  • 노드가 발언을 나타내고, 간선이 내모달(문맥적) 및 이질모달(상호작용적) 관계를 인코딩하는 방향성 그래프를 구축한다.
  • 다양한 모달을 공유되지만 서로 다른 저차원 공간으로 투영하기 위해 다중 하위공간 추출기를 적용하여 모달 간 이질성 감소를 도모한다.
  • 한 모달의 특징이 다른 모달의 누락되거나 모호한 신호를 보완할 수 있도록 명시적으로 모델링하는 쌍별 다중모달 보완 전략(PairCC)을 구현한다.
  • 그래프 어텐션 메커니즘과 다층퍼셉트론을 조합하여 모달 간 및 대화 이력에 걸쳐 동적 어조 가중 특징 표현을 학습하는 GAT-MLP 아키텍처를 설계한다.
  • 그래프 내 메시지 전파를 통해 표현을 전파하고 정제함으로써 장거리 의존성과 대화자 간 역학을 포착할 수 있도록 한다.
  • 다중모달 대화 데이터에서 다중클래스 감정 분류를 위한 교차 엔트로피 손실을 사용하여 모델을 엔드 투 엔드로 훈련한다.

실험 결과

연구 질문

  • RQ1기존의 GNN보다 방향성 그래프 기반 접근법이 다중모달 대화에서 문맥적 및 상호작용적 정보를 더 잘 모델링할 수 있는가?
  • RQ2다중모달 특징 보완 전략이 감정 인식에서 텍스트, 음성, 시각적 모달 간의 이질성 격차를 얼마나 효과적으로 줄일 수 있는가?
  • RQ3GraphCFC는 단모달 및 조기 융합 모델에서 흔한 감정 이동 문제를 어느 정도 완화하는가?
  • RQ4제안된 GAT-MLP 아키텍처는 이전의 GNN 기반 모델 대비 더 효과적이고 통합적인 다중모달 학습 프레임워크를 제공하는가?
  • RQ5GraphCFC는 굵은(3감정) 및 세밀한(6또는 7감정) 레이블링과 같은 다양한 감정 레이블링 체계에 일반화 가능한가?

주요 결과

  • IEMOCAP 데이터셋에서 3감정 설정 하에서 GraphCFC는 88.48% 정확도 및 80.20% 가중 F1 점수를 기록하였으며, MMGCN 대비 정확도 0.61% 향상 및 F1 점수 1.20% 향상되었다.
  • MELD 데이터셋에서 GraphCFC는 75.12% 정확도 및 68.12% 가중 F1 점수를 기록하였으며, MMGCN 대비 정확도 0.61%p 향상 및 F1 점수 1.20%p 향상되었다.
  • 사례 연구 결과, GraphCFC는 단모달 또는 조기 융합 모델이 'Neural'로 잘못 분류하는 'Excited' 또는 'Sad'와 같은 감정적으로 빈약한 발언을 정확히 식별하는 데 성공하였다.
  • 모델은 연속된 'Neural' 발언 후 'Neural'으로 편향되는 경향이 있는 MMGCN 등의 모델에서 흔한 감정 이동 오류를 다중모달 신호를 활용함으로써 효과적으로 줄였다.
  • PairCC 전략과 다중 하위공간 추출기는 특히 한 모달이 모호하거나 노이즈가 많을 경우 특징 보완 성능을 크게 향상시켰다.
  • GAT-MLP 아키텍처는 IEMOCAP 및 MELD 데이터셋 전반에서 일관된 성능 향상을 입증함으로써 더 나은 표현 학습을 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.