Skip to main content
QUICK REVIEW

[논문 리뷰] MoEL: Mixture of Empathetic Listeners

Zhaojiang Lin, Andrea Madotto|arXiv (Cornell University)|2019. 08. 21.
Topic Modeling참고 문헌 62인용 수 7
한 줄 요약

MoEL은 특정 감정에 최적화된 전문화된 청취자들로 구성된 혼합 모델을 사용하여 맥락에 맞고 정서적으로 반응하는 대화 응답을 생성하는 새로운 엔드 투 엔드 공감 대화 시스템을 제안한다. 사용자 감정을 예측한 바탕으로 가장 관련성이 높은 청취자를 동적으로 선택함으로써 MoEL은 기준 모델 대비 뛰어난 공감 능력, 유창성, 관련성과 함께 높은 응답 생성의 해석 가능성(해석 가능성)을 달성한다.

ABSTRACT

Previous research on empathetic dialogue systems has mostly focused on generating responses given certain emotions. However, being empathetic not only requires the ability of generating emotional responses, but more importantly, requires the understanding of user emotions and replying appropriately. In this paper, we propose a novel end-to-end approach for modeling empathy in dialogue systems: Mixture of Empathetic Listeners (MoEL). Our model first captures the user emotions and outputs an emotion distribution. Based on this, MoEL will softly combine the output states of the appropriate Listener(s), which are each optimized to react to certain emotions, and generate an empathetic response. Human evaluations on empathetic-dialogues (Rashkin et al., 2018) dataset confirm that MoEL outperforms multitask training baseline in terms of empathy, relevance, and fluency. Furthermore, the case study on generated responses of different Listeners shows high interpretability of our model.

연구 동기 및 목표

  • 기존 공감 대화 모델이 감정을 잘못 해석하거나 고정된 감정 조건화에 의존하는 등의 한계를 해결하기 위해.
  • 사용자 감정 이해를 바탕으로 적절한 정서적 응답을 선택하는 법을 명시적으로 학습하는 모델을 개발하기 위해.
  • 응답 생성을 감정별로 특화된 디코더로 분리함으로써 응답의 자연스러움, 관련성, 공감 능력을 향상시키기 위해.
  • 개별 청취자 행동과 주의 메커니즘 분석이 가능하게 함으로써 해석 가능성(해석 가능성)을 향상시키기 위해.

제안 방법

  • 모델은 대화 맥락에서 사용자의 정서 상태를 예측하기 위해 감정 추적기(emotion tracker)를 사용하며, n개의 가능한 감정에 대해 감정 분포를 출력한다.
  • 각각 특정 감정(sad, angry, excited 등)에 대해 공감 응답을 생성하도록 훈련된 n개의 전문화된 디코더, 즉 '청취자'들을 사용한다.
  • 메타-청취자는 예측된 감정 분포를 기반으로 소프트 주의 메커니즘(soft attention mechanism)을 사용해 이러한 청취자들의 은닉 상태를 동적으로 조합한다.
  • 최종 응답은 메타-청취자가 여러 청취자로부터 정보를 융합하여 맥락과 감정에 맞는 응답을 생성함으로써 생성된다.
  • 모델은 공감 대화 데이터셋에서 최대 우도 추정(maximum likelihood estimation)을 사용해 엔드 투 엔드로 훈련되며, 감정 분류와 응답 생성을 동시에 최적화한다.
  • 제어된 감정 입력 하에서 개별 청취자의 응답을 분석함으로써 해석 가능성(해석 가능성)이 향상된다.

실험 결과

연구 질문

  • RQ1사용자의 정서 상태를 이해함으로써 대화 시스템이 자동으로 가장 적절한 정서적 응답을 선택할 수 있는가?
  • RQ2응답 생성을 감정별로 특화된 청취자들로 분리함으로써 통합된 응답 모델 대비 공감 능력과 응답 품질이 어떻게 향상되는가?
  • RQ3모델의 내부 주의 메커니즘이 주어진 정서 맥락에서 정확히 적절한 청취자를 식별하고 활용할 수 있는가?
  • RQ4개별 청취자가 서로 다른 정서적 응답 패턴을 학습하고 있으며, 제어된 감정 입력 하에서 예상한 대로 행동하는가?
  • RQ5여러 감정이 한 번에 공존하는 다중 감정 맥락에서 모델은 어떻게 작동하는가?

주요 결과

  • MoEL은 Rashkin 등(2018)의 공감 대화 데이터셋에서 인간 평가에서 다중 작업 훈련 기준 모델 대비 공감 능력, 관련성, 유창성 측면에서 뛰어난 성능을 보이며, 더 높은 수준의 응답 품질을 입증한다.
  • 모델은 높은 해석 가능성(해석 가능성)을 달성하였으며, 사례 연구에서 각 청취자가 목표 감정이 입력되었을 때 정서적으로 적절한 응답을 생성하는 것으로 확인되었다.
  • 메타-청취자는 예측된 감정을 바탕으로 정확히 적절한 청취자를 주의 집중함을 시각화된 주의 분포와 감정 분류 정확도로 확인하였다.
  • 다중 감정 맥락에서는 MoEL이 동시에 여러 청취자를 활용하여 다수의 감정(예: 두려움과 짜증)을 다루는 응답을 생성함으로써 더 포괄적인 공감 능력을 발휘하였다.
  • 맥락에 모순되거나 모호한 감정 신호가 포함되어 있을 경우 감정을 잘못 분류하는 경우가 있어 최적의 청취자 선택이 어려워지고 약간의 사실 오류(예: 대명사 오류)가 발생할 수 있으나, 전반적으로는 높은 안정성을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.