Skip to main content
QUICK REVIEW

[논문 리뷰] S+PAGE: A Speaker and Position-Aware Graph Neural Network Model for Emotion Recognition in Conversation

Liang Chen, Chong Yang|arXiv (Cornell University)|2021. 12. 23.
Emotion and Mood Recognition인용 수 7
한 줄 요약

S+PAGE는 대화에서 정서 인식을 위한 새로운 그래프 신경망 모델로, 이중 스트림 대화 트랜스포머와 위치 인식 그래프 컨볼루션 네트워크(PAG)를 통해 화자 신원과 발언 위치를 통합한다. 상대적 위치 인코딩과 CRF 기반의 레이블 일관성 모델링을 통해 자가 화자 및 상호 화자 맥락을 동시에 모델링함으로써, IEMOCAP(68.72 F1)와 MELD(63.32 F1)에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Emotion recognition in conversation (ERC) has attracted much attention in recent years for its necessity in widespread applications. Existing ERC methods mostly model the self and inter-speaker context separately, posing a major issue for lacking enough interaction between them. In this paper, we propose a novel Speaker and Position-Aware Graph neural network model for ERC (S+PAGE), which contains three stages to combine the benefits of both Transformer and relational graph convolution network (R-GCN) for better contextual modeling. Firstly, a two-stream conversational Transformer is presented to extract the coarse self and inter-speaker contextual features for each utterance. Then, a speaker and position-aware conversation graph is constructed, and we propose an enhanced R-GCN model, called PAG, to refine the coarse features guided by a relative positional encoding. Finally, both of the features from the former two stages are input into a conditional random field layer to model the emotion transfer.

연구 동기 및 목표

  • 기존 ERC 모델이 다중 대화에서 자가 화자 및 상호 화자 맥락을 동시에 포착하는 데 한계를 보이는 문제를 해결하기 위해.
  • 그래프 신경망에 상대적 위치 인코딩을 통합하여 대화 내 세밀한 시간적 의존성을 향상시키기 위해.
  • 맥락 모델링, 화자 의존성 학습, 레이블 일관성 모델링을 통합하여 정서 인식 성능을 향상시키기 위해.
  • 더 큰 규모의 다자 대화를 보다 효율적이고 강력하게 처리할 수 있도록 하기 위해.

제안 방법

  • 주의 마스킹을 갖춘 이중 스트림 대화 트랜스포머(TSCT)를 사용하여 거시적 자가 화자 및 상호 화자 맥락 특징을 추출한다.
  • 발언 순서와 화자 신원을 기반으로 화자 및 위치 인식 대화 그래프를 구성한다.
  • 세분화된 시간 정보를 활용해 특징을 정교화하기 위해 상대적 위치 인코딩을 통합한 개선된 관계 기반 GCN, 즉 PAG를 제안한다.
  • PAG 모델은 메시지 전파 과정에 화자 신원과 상대적 위치를 통합하여 장거리 의존성과 정서적 영향 패턴을 포착한다.
  • 조건부 랜덤 필드(CRF) 레이어를 통해 발언 간 정서 레이블 전이를 모델링하여 예측 레이블의 일관성을 강제한다.
  • 최종 모델은 TSCT와 PAG의 특징을 결합하여 엔드 투 엔드 정서 분류를 수행한다.

실험 결과

연구 질문

  • RQ1통합 모델이 다중 턴 대화에서 자가 화자 및 상호 화자 맥락 의존성을 효과적으로 포착할 수 있는가?
  • RQ2그래프 신경망에 상대적 위치 인코딩을 통합함으로써 정서 인식에서 시간 모델링이 어떻게 향상되는가?
  • RQ3맥락 특징과 레이블 일관성의 공동 모델링이 정서 인식 성능 향상에 어느 정도 기여하는가?
  • RQ4기존 최신 기술 수준(SOTA) 모델과 비교할 때 제안된 아키텍처는 표준 ERC 벤치마크에서 어떻게 성능을 내는가?

주요 결과

  • S+PAGE는 IEMOCAP 데이터셋에서 가중 F1 점수 68.72를 기록하여 이전 최신 기술 수준 모델을 초월한다.
  • MELD 데이터셋에서는 가중 F1 점수 63.32를 기록하여 다양한 대화 스타일 간 강력한 일반화 능력을 보여준다.
  • 제거 실험 결과, 이중 스트림 대화 트랜스포머를 제거할 경우 IEMOCAP에서 0.89점, MELD에서 1.47점의 점수 하락이 발생하여 다중 화자 맥락에서의 중요성을 확인한다.
  • PAG 모듈를 제거할 경우 IEMOCAP에서 4.58점, MELD에서 2.25점의 점수 하락이 발생하여, 화자 의존성 및 시간 모델링에서의 핵심적 역할을 입증한다.
  • CRF 레이어 제거 시 IEMOCAP에서 F1 점수 0.65점 하락이 발생하여, 레이블 일관성 모델링이 성능 향상에 기여한다는 것을 시사한다.
  • 모델은 다양한 윈도우 크기에서도 안정적인 성능을 유지하며 최소한의 변동성을 보이며, 장거리 맥락 변화에 대한 강건성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.