Skip to main content
QUICK REVIEW

[논문 리뷰] Generating Persona-Consistent Dialogue Responses Using Deep Reinforcement Learning

Mohsen Mesgar, Edwin Simpson|arXiv (Cornell University)|2020. 04. 30.
Topic Modeling참고 문헌 21인용 수 6
한 줄 요약

이 논문은 퍼스널리티 일관성 있는 응답 생성을 위한 트랜스포머 기반 대화 에이전트를 훈련하기 위해 참조에 의존하지 않는 액터-크리틱 강화학습 프레임워크를 제안한다. 대화 이력과 퍼스널리티 사실에 기반한 새로운 보상 함수를 정의함으로써, 퍼스널리티 일관성, 주제 일관성, 유창성 등을 측정하며, PERSONACHAT 데이터셋에서 자동 평가 및 인간 평가를 통해 검증된 결과, 지도 학습 기반 베이스라인에 비해 훨씬 높은 퍼스널리티 일관성을 달성한다.

ABSTRACT

Recent transformer-based open-domain dialogue agents are trained by reference responses in a fully supervised scenario. Such agents often display inconsistent personalities as training data potentially contain contradictory responses to identical input utterances and no persona-relevant criteria are used in their training losses. We propose a novel approach to train transformer-based dialogue agents using actor-critic reinforcement learning. We define a new reward function to assess generated responses in terms of persona consistency, topic consistency, and fluency. Our reference-agnostic reward relies only on a dialogue history and a persona defined by a list of facts. Automatic and human evaluations on the PERSONACHAT dataset show that our proposed approach increases the rate of persona-consistent responses compared with its peers that are trained in a fully supervised scenario using reference responses.

연구 동기 및 목표

  • 감독 학습을 통해 훈련된 트랜스포머 기반 대화 에이전트에서 일관되지 않은 성격 표현 문제를 해결하기 위해.
  • 훈련 중 참조 응답에 의존하지 않도록 참조에 의존하지 않는 훈련 프레임워크를 개발하여 의존도를 제거하기 위해.
  • 단지 대화 이력과 퍼스널리티 사실에 기반한 보상 함수를 통해 생성된 응답의 퍼스널리티 일관성을 향상시키기 위해.
  • PERSONACHAT 데이터셋에서 자동 평가 지표와 인간 애너테이션을 사용하여 제안된 방법의 효과성을 평가하기 위해.

제안 방법

  • 트랜스포머 기반 대화 정책을 훈련하기 위해 액터-크리틱 강화학습 프레임워크를 사용한다.
  • 대화 이력과 퍼스널리티 사실만을 사용하여 퍼스널리티 일관성, 주제 일관성, 유창성 기반으로 응답을 평가하는 새로운 보상 함수를 설계한다.
  • 참조 응답이 필요로 하지 않는 정책 그래เดียน트 방법을 사용하여 정책을 엔드 투 엔드로 최적화하며, 정의된 보상 신호를 최적화한다.
  • 생성된 응답과 주어진 퍼스널리티 사실 간의 일치도를 임베딩 유사도 또는 매칭 메커니즘을 통해 계산함으로써 퍼스널리티 일관성을 정의한다.
  • 대화 이력 내 연속적인 발언 간의 일관성 정도를 측정하여 주제 일관성을 확보한다.
  • 보상 함수에 통합된 표준 언어 모델링 목표를 통해 유창성을 유지한다.

실험 결과

연구 질문

  • RQ1참조에 의존하지 않는 강화학습 접근법이 감독 미세조정 대비 개방형 대화 시스템에서 퍼스널리티 일관성을 향상시킬 수 있는가?
  • RQ2단지 대화 이력과 퍼스널리티 사실에 기반한 보상 함수가 일관된 성격 표현을 촉진하는 데 얼마나 효과적인가?
  • RQ3제안된 방법이 인간 평가에서 퍼스널리티 일관성 측면에서 지도 학습 기반 베이스라인에 비해 어느 정도 뛰어나게 성능을 발휘하는가?
  • RQ4제안된 방법은 퍼스널리티 준수를 향상시키는 동안 유창성과 주제 일관성도 유지하거나 향상시키는가?

주요 결과

  • 제안된 강화학습 접근법은 PERSONACHAT 데이터셋에서 지도 학습 기반 베이스라인에 비해 더 높은 퍼스널리티 일관성 응답 비율을 달성한다.
  • 인간 평가 결과, 모델이 참조 기반 지도 학습 모델보다 주어진 퍼스널리티와 더 잘 일치하는 응답을 생성하는 것으로 확인된다.
  • 자동 평가 결과는 참조 응답에 의존하지 않음에도 불구하고 퍼스널리티 일관성 지표에서 뚜렷한 향상을 보였다.
  • 모델은 유창성과 주제 일관성 측면에서도 뛰어난 성능을 유지하여 응답 품질 저하가 없음을 시사한다.
  • 보상 함수는 정책이 맥락적으로 관련성 있고 성격 일관성이 있는 응답을 생성하도록 효과적으로 이끌었다.
  • 다양한 퍼스널리티 프로파일에 걸쳐 잘 일반화되어 있어, 일관된 성격 특성을 유지하는 데 있어 뛰어난 강건성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.