Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Conversational Systems that Interleave Task and Non-Task Content

Yu Zhou, Alan W. Black|arXiv (Cornell University)|2017. 03. 01.
Topic Modeling참고 문헌 20인용 수 15
한 줄 요약

이 논문은 작업 중심 대화 시스템과 비작업(사회적) 콘텐츠를 혼합하여 대화 시스템의 작업 성공률과 사용자 참여도를 향상시키기 위해 강화학습 기반 프레임워크를 제안한다. 대화 유형 간의 매끄러운 전환을 가능하게 하는 정책을 학습시킴으로써, 인간 사용자를 대상으로 한 영화 홍보 대화 시스템에서 순수 작업 중심 시스템에 비해 더 높은 작업 성공률과 더 나은 사용자 평가를 달성하였다.

ABSTRACT

Task-oriented dialog systems have been applied in various tasks, such as automated personal assistants, customer service providers and tutors. These systems work well when users have clear and explicit intentions that are well-aligned to the systems' capabilities. However, they fail if users intentions are not explicit. To address this shortcoming, we propose a framework to interleave non-task content (i.e. everyday social conversation) into task conversations. When the task content fails, the system can still keep the user engaged with the non-task content. We trained a policy using reinforcement learning algorithms to promote long-turn conversation coherence and consistency, so that the system can have smooth transitions between task and non-task content. To test the effectiveness of the proposed framework, we developed a movie promotion dialog system. Experiments with human users indicate that a system that interleaves social and task content achieves a better task success rate and is also rated as more engaging compared to a pure task-oriented system.

연구 동기 및 목표

  • 사용자의 명확하지 않거나 암시적인 의도를 처리하지 못하는 작업 중심 대화 시스템의 한계를 해결하기 위해.
  • 작업 중심 콘텐츠와 사회적 대화를 자연스럽게 혼합함으로써 사용자 참여도와 작업 성공률을 향상시키기 위해.
  • 고객 서비스, 공중보건, 정치적 설문 조사와 같은 분야에 적용 가능한 일반화 가능한 프레임워크를 개발하기 위해.
  • 혼합 콘텐츠 대화에서 장기적인 대화 일관성과 일관성을 최적화하는 강화학습을 사용한 대화 정책을 훈련하기 위해.
  • 실제 세계의 영화 홍보 대화 시스템을 활용해 인간 평가를 통해 프레임워크를 검증하기 위해.

제안 방법

  • 대화 맥락에 기반해 작업 중심 및 비작업(사회적) 응답 간 전환을 선택하는 대화 정책을 강화학습을 통해 훈련한다.
  • 대화의 장기적 효과성, 즉 일관성, 깊이, 정보량 증가 등을 최적화한다.
  • 시험용으로 영화 홍보 시스템을 구현하였으며, 이 시스템은 사용자 선호도를 수집하여 영화를 추천한다.
  • 작업 전용 응답과 사회적으로 유인적인 콘텐츠를 조합한 하이브리드 응답 생성 방식을 사용한다.
  • 응답 일관성 및 작업 성공률과 같은 핵심 지표를 고려해 보상 설계를 적용한 시뮬레이션 및 실제 인간 상호작용을 통해 강화학습 에이전트를 훈련한다.
  • 오픈소스 코드와 데이터를 제공하여 다른 분야에서도 재사용 가능한 일반적이고 확장 가능한 프레임워크이다.

실험 결과

연구 질문

  • RQ1작업 중심 대화 시스템에 비작업(사회적) 콘텐츠를 혼합함으로써 사용자 참여도와 작업 성공률을 향상시킬 수 있는가?
  • RQ2작업 중심 콘텐츠와 비작업 콘텐츠 간의 매끄럽고 일관된 전환을 보장하기 위해 대화 정책을 어떻게 훈련할 수 있는가?
  • RQ3실제 인간 상호작용에서 작업과 사회적 대화를 융합한 시스템이 순수 작업 중심 시스템보다 우수한가?
  • RQ4사회적 콘텐츠의 통합이 장기적인 대화 품질 향상과 정보 수집 능력 향상에 어느 정도 기여하는가?
  • RQ5이 프레임워크는 공중보건, 교육, 정치적 설문 조사와 같은 다양한 분야로 일반화될 수 있는가?

주요 결과

  • 작업 및 비작업 콘텐츠를 혼합하는 Mix-Global 시스템은 인간 사용자를 대상으로 76.7%의 작업 성공률을 기록했으며, 순수 작업 중심 시스템인 Task-Global에 비해 유의미하게 높았다.
  • 인간 사용자를 대상으로 한 실험에서 Mix-Global 시스템은 대화 깊이 79%와 정보 양 67.2%를 기록하여 시뮬레이션 및 기준 시스템을 모두 능가했다.
  • 응답 일관성(App)이 사회적 콘텐츠 통합으로 가장 크게 향상되어, 매끄러운 전환으로 전체 시스템 성능 향상이 이루어졌음을 시사했다.
  • 동일한 작업 기반을 공유함에도 불구하고, 사용자 평가에서 순수 작업 중심 시스템보다 더 높은 참여도를 보였다.
  • 수집된 데이터는 남성과 20세 연령대 사용자가 슈퍼히어로 영화에 더 높은 관심을 보이며 참여하는 경향이 있음을 보여주었으며, 이는 업계 트렌드와 일치했다.
  • 이 프레임워크는 영화 홍보를 넘어서 정치적 설문 조사, 공중보건 교육, 고객 서비스 등 다양한 분야에 적용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.