Skip to main content
QUICK REVIEW

[논문 리뷰] Online Sequence-to-Sequence Reinforcement Learning for Open-Domain Conversational Agents

Nabiha Asghar, Pascal Poupart|arXiv (Cornell University)|2016. 12. 12.
Topic Modeling인용 수 10
한 줄 요약

이 논문은 오프라인 지도 학습과 온라인 인간 중심의 능동적 학습을 결합한 온라인, 엔드 투 엔드 신경 시퀀스 투 시퀀스 모델을 제안한다. 이는 한 글자 사용자 피드백과 해밍-다양한 빔 서치를 사용한다. 이 방법은 수동으로 설계된 보상 함수 없이도 개인화된 대화 생성을 가능하게 하며, 의미적으로 관련성 있고 매력적인 응답을 생성한다.

ABSTRACT

We propose an online, end-to-end, neural generative conversational model for open-domain dialogue. It is trained using a unique combination of offline two-phase supervised learning and online human-in-the-loop active learning. While most existing research proposes offline supervision or hand-crafted reward functions for online reinforcement, we devise a novel interactive learning mechanism based on hamming-diverse beam search for response generation and one-character user-feedback at each step. Experiments show that our model inherently promotes the generation of semantically relevant and interesting responses, and can be used to train agents with customized personas, moods and conversational styles.

연구 동기 및 목표

  • 실시간으로 사용자 선호도에 적응하는 학습 가능한 엔드 투 엔드 대화 에이전트를 개발하는 것.
  • 대화 정책 학습에서 오프라인 지도 학습과 수동으로 설계된 보상 함수의 한계를 극복하는 것.
  • 사용자 정의 가능한 성격, 기분, 대화 스타일을 갖춘 개인화된 대화 시스템을 가능하게 하는 것.
  • 최소한의 사용자 피드백(한 글자 응답)을 사용하여 응답 생성을 이끄는 상호작용 학습 메커니즘을 설계하는 것.
  • 새로운 빔 서치 전략을 통해 의미적 관련성과 다양성을 향상시키는 것.

제안 방법

  • 모델는 두 단계 학습 과정을 사용한다: 먼저 오프라인 대화 데이터에서 지도 미세조정을 수행한 후, 온라인 능동 학습을 수행한다.
  • 온라인 학습은 각 턴에서 한 글자 사용자 피드백을 사용하여 즉각적이고 최소한의 지도를 제공한다.
  • 응답 생성 시 해밍-다양한 빔 서치를 사용하여 의미적으로 다양한 응답 후보를 탐색한다.
  • 상호작용 루프는 인간의 피드백을 정책 업데이트에 통합하여 생성 정책의 실시간 적응을 가능하게 한다.
  • 직접적인 인간 피드백에 의존함으로써 수동으로 설계된 보상 함수를 회피한다.
  • 모델는 엔드 투 엔드로 학습되어 응답 생성과 정책 적응의 공동 최적화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1온라인 인간 중심 학습이 오프라인 지도 학습에 비해 오픈 도메인 대화 시스템의 응답 품질을 향상시키는가?
  • RQ2한 글자 피드백가 의미적으로 관련성 있고 다양한 응답을 생성하는 데 얼마나 효과적인가?
  • RQ3제안된 방법이 서로 다른 성격, 기분, 대화 스타일을 가진 대화 에이전트를 개인화하는 데 성공하는가?
  • RQ4해밍-다양한 빔 서치가 복잡한 보상 형태 설계 없이도 응답의 다양성과 관련성을 향상시키는가?
  • RQ5최소한의 피드백을 사용한 엔드 투 엔드 학습이 수동으로 설계된 보상 함수 없이도 뛰어난 성능을 달성할 수 있는가?

주요 결과

  • 모델는 수동으로 설계된 보상 함수에 의존하지 않고도 의미적으로 관련성 있고 매력적인 응답을 생성한다.
  • 한 글자 사용자 피드백이 학습 과정을 효과적으로 이끌며, 대화 정책의 실시간 적응을 가능하게 한다.
  • 해밍-다양한 빔 서치의 사용은 관련성을 유지하면서도 생성된 응답의 다양성을 증진시킨다.
  • 시스템은 사용자 정의 가능한 성격, 기분, 대화 스타일을 갖춘 에이전트의 훈련을 성공적으로 지원한다.
  • 오프라인 사전 훈련과 온라인 능동 학습의 조합은 순수하게 오프라인 방법에 비해 응답 품질을 향상시킨다.
  • 상호작용 학습을 통해 모델는 흥미롭고 맥락에 적절한 응답을 생성하는 본질적인 능력을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.