Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Coherent and Engaging Spoken Dialog Response Generation Using Automatic Conversation Evaluators

Sanghyun Yi, Rahul Goel|arXiv (Cornell University)|2019. 04. 30.
Topic Modeling참고 문헌 45인용 수 15
한 줄 요약

이 논문은 개방형 대화 시스템의 응답 일관성과 참여도를 측정하는 턴 단위 자동 대화 평가기(automatic conversational evaluator)를 제안한다. 재정렬과 복합 손실 함수를 통한 평가기 피드백 통합을 통해 응답 품질이 크게 향상되었으며, 자동 평가와 인간 평가 모두에서 베이스라인을 능가하여 BLEU-4에서 103% 향상되고 인간 평가에서 참여도 점수는 2.31를 기록했다.

ABSTRACT

Encoder-decoder based neural architectures serve as the basis of state-of-the-art approaches in end-to-end open domain dialog systems. Since most of such systems are trained with a maximum likelihood~(MLE) objective they suffer from issues such as lack of generalizability and the generic response problem, i.e., a system response that can be an answer to a large number of user utterances, e.g., "Maybe, I don't know." Having explicit feedback on the relevance and interestingness of a system response at each turn can be a useful signal for mitigating such issues and improving system quality by selecting responses from different approaches. Towards this goal, we present a system that evaluates chatbot responses at each dialog turn for coherence and engagement. Our system provides explicit turn-level dialog quality feedback, which we show to be highly correlated with human evaluation. To show that incorporating this feedback in the neural response generation models improves dialog quality, we present two different and complementary mechanisms to incorporate explicit feedback into a neural response generation model: reranking and direct modification of the loss function during training. Our studies show that a response generation model that incorporates these combined feedback mechanisms produce more engaging and coherent responses in an open-domain spoken dialog setting, significantly improving the response quality using both automatic and human evaluation.

연구 동기 및 목표

  • 최대 우도 목표를 사용해 훈련하는 엔드 투 엔드 신경망 대화 시스템에서의 일반적인 응답 문제를 해결하기 위해.
  • 각 시스템 응답에 대해 일관성과 참여도에 대한 해석 가능한 피드백을 제공하는 턴 단위 자동 평가기를 개발하기 위해.
  • 재정렬과 손실 함수 수정이라는 두 가지 상호보완적 메커니즘을 통해 평가기 피드백을 응답 생성에 통합하기 위해.
  • 자동 평가와 인간 평가를 모두 활용하여 개방형 구두 대화 환경에서 대화 품질을 향상시키기 위해.
  • Reddit 및 Alexa Prize 데이터를 포함한 다양한 데이터셋 간의 평가기 일반화 능력을 입증하기 위해.

제안 방법

  • 대화 이력과 수작업으로 만든 특징(예: 턴 단위 컨텍스트, 어휘 일치도)의 고정 길이 벡터 표현을 입력으로 사용하는 지도 학습 기반의 대화 평가기.
  • 평가기는 인간이 애너테이션한 대화 데이터를 기반으로 훈련되어 일관성과 참여도에 대한 명시적 점수를 출력한다.
  • 피드백은 재정렬을 통해 통합된다: 빔 서치에서 생성된 n개의 최고 응답들이 평가기 출력을 기반으로 재점수되어 가장 일관성 있고 참여도가 높은 응답이 선택된다.
  • 복합 손실 함수가 도입되며, 최대 우도 손실과 평가기 점수를 기반으로 한 판별적 손실을 조합하여 엔드 투 엔드 훈련을 이끌어낸다.
  • 모델은 Alexa Prize 데이터셋에서 파인튜닝되며, 자동 평가 지표와 인간 애너테이션을 모두 활용해 평가된다.
  • 평가기는 파인튜닝 없이도 Reddit 데이터에 대해 테스트되어 인간-인간 대화에 대한 일반화 능력을 입증한다.

실험 결과

연구 질문

  • RQ1자동 평가기가 개방형 대화 시스템에서 일관성과 참여도에 대해 신뢰할 수 있는 턴 단위 피드백을 제공할 수 있는가?
  • RQ2재정렬을 통한 자동 평가기 피드백 통합이 응답 품질 향상에 얼마나 효과적인가?
  • RQ3평가기 피드백을 사용해 훈련 손실을 직접 수정하면 재정렬만으로는 달성할 수 없는 응답 품질 향상이 가능한가?
  • RQ4평가기가 인간-컴퓨터 상호작용과 인간-인간 상호작용 등 다양한 대화 도메인에 일반화되는가?
  • RQ5두 피드백 메커니즘의 조합이 자동 평가 지표와 인간 평가 지표 양쪽 모두에서 얼마나 향상시키는가?

주요 결과

  • 제안된 자동 평가기는 인간 평가와 높은 상관성을 보이며, 상호 애너테이터 간 일致도에서 0.42의 Cohen’s Kappa를 기록하여 주관적인 인간 판단에서 신뢰할 수 있는 신호를 효과적으로 추출함을 입증했다.
  • 재정렬과 복합 손실을 조합한 S2S_RR_FT 모델이 인간 평가에서 가장 높은 성능을 보이며, 일관성 점수 2.55와 참여도 점수 2.31를 기록했다.
  • 재정렬 메커니즘만으로도 Reddit 데이터셋에서 BLEU-4가 103% 향상(3.9에서 7.9로)되고 Distinct-2는 82% 향상되었으며, 이는 다른 코퍼스에서 훈련된 모델임에도 불구하고 성과를 보였다.
  • 복합 손실로 훈련된 모델(S2S_FT)은 기본 모델 대비 일관성 점수를 3.4% 향상시키고 참여도 점수를 20% 향상시켰다.
  • 재정렬과 복합 손실의 조합(S2S_RR_FT)은 개별 방법보다 뛰어난 성능을 보이며, 상호보완적 이점을 입증했다.
  • 평가기는 파인튜닝 없이도 Reddit 데이터에 효과적으로 일반화되어 다양한 도메인 간 강건성과 전이 가능성(transferability)을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.