Skip to main content
QUICK REVIEW

[논문 리뷰] Teaching Machines to Converse

Jiwei Li|arXiv (Cornell University)|2020. 01. 31.
Topic Modeling참고 문헌 150인용 수 5
한 줄 요약

이 학위논문은 신경 대화 모델의 핵심 과제인 일반적인 응답, 일관되지 않은 사용자 성격, 장기적 일관성 부족, 인간 상호작용으로부터의 학습 능력 부족을 해결함으로써 개방형 대화 시스템을 향상시키는 프레임워크를 제안한다. 상호정보량 최대화, 강화학습, 적대적 훈련, 상호작용 기반 학습을 도입하여 사용자와의 온라인 상호작용을 통해 더 매력적이고 맥락에 부합하며 인간다운 응답을 생성한다.

ABSTRACT

The ability of a machine to communicate with humans has long been associated with the general success of AI. This dates back to Alan Turing's epoch-making work in the early 1950s, which proposes that a machine's intelligence can be tested by how well it, the machine, can fool a human into believing that the machine is a human through dialogue conversations. Many systems learn generation rules from a minimal set of authored rules or labels on top of hand-coded rules or templates, and thus are both expensive and difficult to extend to open-domain scenarios. Recently, the emergence of neural network models the potential to solve many of the problems in dialogue learning that earlier systems cannot tackle: the end-to-end neural frameworks offer the promise of scalability and language-independence, together with the ability to track the dialogue state and then mapping between states and dialogue actions in a way not possible with conventional systems. On the other hand, neural systems bring about new challenges: they tend to output dull and generic responses; they lack a consistent or a coherent persona; they are usually optimized through single-turn conversations and are incapable of handling the long-term success of a conversation; and they are not able to take the advantage of the interactions with humans. This dissertation attempts to tackle these challenges: Contributions are two-fold: (1) we address new challenges presented by neural network models in open-domain dialogue generation systems; (2) we develop interactive question-answering dialogue systems by (a) giving the agent the ability to ask questions and (b) training a conversation agent through interactions with humans in an online fashion, where a bot improves through communicating with humans and learning from the mistakes that it makes.

연구 동기 및 목표

  • 개방형 대화에서 지루하고 일반적이거나 일관성 없는 응답을 생성하는 신경 대화 모델의 한계를 극복하기 위해.
  • 대표 표현 학습과 기억 메커니즘을 통해 장기간 대화 동안 일관된 사용자 성격을 유지할 수 있도록 대화 에이전트를 가능하게 하기 위해.
  • 다중 턴에 걸쳐 대화의 일관성과 참여도를 최적화하는 강화학습을 통해 훈련함으로써 장기적 대화 성공률을 향상시키기 위해.
  • 실시간으로 인간 피드백을 받는 상호작용 기반 학습 시스템을 개발하여 대화 에이전트가 시간이 지남에 따라 향상되도록 하기 위해.
  • 텍스트, 시각적 정보, 그리고 의미적 추론를 포함한 다중 모odal 맥락을 대화 생성에 통합하여 더 기반된, 맥락에 정확한 응답을 제공하기 위해.

제안 방법

  • 대화 이력과 응답 후보 간의 상호정보량을 최대화하여 일반적인 응답을 줄이고 관련성을 향상시키기 위해.
  • 인간 선호 신호를 활용한 강화학습을 통해 단일 턴 정확도가 아닌 장기적 대화 성공률을 최적화하기 위해.
  • 인간 평가에서 모델이 생성한 응답이 인간이 작성한 것과 구분되지 않도록 하기 위해 적대적 훈련을 적용하기 위해.
  • 에이전트가 적극적으로 질문을 하고 사용자와의 온라인 상호작용을 통해 향상되는 상호작용 기반 학습 프레임워크를 설계하기 위해.
  • 주의 메커니즘을 사용하여 대화 이력에서 핵심 정보를 추출하여 주목할 만한 맥락에 집중함으로써 응답의 맥락 기반 성능을 향상시키기 위해.
  • 대규모 데이터로부터 암묵적인 추론 체인 학습을 통해 논리적 추론 및 일반 지식을 대화 생성에 통합하기 위해.

실험 결과

연구 질문

  • RQ1신경 대화 모델이 일반적이거나 반복적인 응답을 생성하는 것을 어떻게 방지할 수 있는가?
  • RQ2대화 에이전트는 장기간의 대화 동안 어떻게 일관된 사용자 성격을 유지할 수 있는가?
  • RQ3장기적 일관성과 개방형 대화의 성공률을 향상시키는 데 효과적인 훈련 목표는 무엇인가?
  • RQ4적대적 훈련이 기계가 생성한 응답을 인간의 응답과 구분하기 어려울 정도로 효과적으로 만들 수 있는가?
  • RQ5대화 에이전트는 실시간 인간 상호작용을 통해 어떻게 시간이 지남에 따라 향상될 수 있는가?

주요 결과

  • 상호정보량 최대화가 개방형 대화 생성에서 '모르겠다'와 같은 일반적인 응답의 빈도를 크게 감소시켰다.
  • 인간 피드백을 통한 강화학습이 장기적 대화 일관성을 향상시켜 더 매력적이고 맥락에 지속적인 대화를 가능하게 하였다.
  • 적대적 훈련을 통해 모델가 생성한 응답이 인간 평가에서 70퍼센트 이상에서 인간다운 것으로 평가되었으며, 기준 모델을 능가하였다.
  • 인간이 참여하는 상호작용 기반 피드백을 통해 에이전트가 실시간으로 행동을 적응시켜 여러 상호작용 라운드 동안 응답 품질을 향상시킬 수 있었다.
  • 대화 이력에서 핵심 정보 추출을 통합함으로써 특히 추적 번호와 같은 중요한 실체를 기억해야 하는 작업에서 응답의 관련성을 향상시켰다.
  • 데이터로부터 암묵적인 논리 체인을 학습함으로써 모델가 맥락적 단서인 '시험을 보는 중'으로부터 '파티에 참석하지 않는다'는 결론을 유추할 수 있는 추론 능력을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.