Skip to main content
QUICK REVIEW

[논문 리뷰] Recommendation as a Communication Game: Self-Supervised Bot-Play for Goal-oriented Dialogue

Dongyeop Kang, Anusha Balakrishnan|arXiv (Cornell University)|2019. 09. 09.
Topic Modeling참고 문헌 28인용 수 7
한 줄 요약

이 논문은 인간-인간 영화 추천 대화를 캡처하는 새로운 데이터셋인 GoRecDial을 사용하여 목표 지향 대화 에이전트를 추천 작업에서 훈련하기 위한 이단계 프레임워크를 제안한다. 인간의 예시에 대해 미세조정한 후에 자기지도 학습 기반의 봇-봇 플레이를 통해 모델을 보완함으로써 대화 전략이 크게 향상되어, 지도 학습 전용 훈련 대비 목표 성공률이 27.7% 상승한다.

ABSTRACT

Traditional recommendation systems produce static rather than interactive recommendations invariant to a user's specific requests, clarifications, or current mood, and can suffer from the cold-start problem if their tastes are unknown. These issues can be alleviated by treating recommendation as an interactive dialogue task instead, where an expert recommender can sequentially ask about someone's preferences, react to their requests, and recommend more appropriate items. In this work, we collect a goal-driven recommendation dialogue dataset (GoRecDial), which consists of 9,125 dialogue games and 81,260 conversation turns between pairs of human workers recommending movies to each other. The task is specifically designed as a cooperative game between two players working towards a quantifiable common goal. We leverage the dataset to develop an end-to-end dialogue system that can simultaneously converse and recommend. Models are first trained to imitate the behavior of human players without considering the task goal itself (supervised training). We then finetune our models on simulated bot-bot conversations between two paired pre-trained models (bot-play), in order to achieve the dialogue goal. Our experiments show that models finetuned with bot-play learn improved dialogue strategies, reach the dialogue goal more often when paired with a human, and are rated as more consistent by humans compared to models trained without bot-play. The dataset and code are publicly available through the ParlAI framework.

연구 동기 및 목표

  • 사용자 요청, 기분, 또는 콜드 스타트 사용자에 대해 적응하지 못하는 정적이고 비상호작용적인 추천 시스템의 한계를 해결하기 위해.
  • 합성 또는 암시적 선호도가 아닌 실제 사용자 선호도(영화 목록에서 유래)에 기반한 대규모 목표 지향 대화 데이터셋을 구축하기 위해.
  • 지도 학습에 기반한 모방 학습과 자기지도 학습 기반의 봇-봇 플레이를 조합하여 대화 전략과 목표 달성을 향상시키는 이단계 훈련 프레임워크를 개발하기 위해.
  • 봇-플레이 미세조정이 인간-봇 상호작용에서 더 효과적이고 일관되며 목표 중심적인 대화 에이전트를 만들어내는지 평가하기 위해.

제안 방법

  • 사용자 시청 이력에 기반한 정확한 목표가 하나인 다섯 편의 영화 중에서 한 명의 전문가가 영화를 추천하는 방식으로, 총 9,125개의 대화와 81,260턴의 인간-인간 대화 데이터셋(GoRecDial)을 수집한다.
  • 전문가 행동을 모방하기 위해 인간의 예시에 기반한 종단간 지도 미세조정을 통해 대화 모델을 훈련시킨다.
  • 두 개의 쌍으로 구성된 사전 훈련된 모델이 상호작용하는 자기지도 학습 기반의 봇-봇 플레이 단계를 구현하여 목표 중심 전략을 개선한다.
  • 목표 성공(정확한 추천)과 대화 효율성(턴 수)을 기반으로 게임 기반의 보상 신호를 사용한다.
  • 모델을 시뮬레이션된 봇-봇 대화를 통해 전략적 행동(예: 선호도 수집 및 효율적 추천)을 향상시키기 위해 미세조정한다.
  • 최종 모델을 인간의 구독자와의 제로샷 설정에서 평가하고, 지도 학습 전용 모델과의 성능을 비교한다.

실험 결과

연구 질문

  • RQ1자기지도 학습 기반의 봇-봇 플레이 미세조정이 지도 학습에 기반한 모방 학습을 넘어서 목표 중심 대화 전략을 향상시킬 수 있는가?
  • RQ2영화 목록에서 유래한 실제 사용자 선호도의 통합이 대화 기반 추천의 품질과 일관성에 어떤 영향을 미치는가?
  • RQ3인간의 예시에 기반한 훈련 후 봇-봇 플레이를 거친 모델이 지도 학습 전용 훈련보다 추천 목표 달성률이 높아지는가?
  • RQ4봇-플레이 동안 대화 길이와 전략은 어떻게 변화하며, 이는 성능 향상과 관련이 있는가?

주요 결과

  • 봇-플레이로 미세조정한 BERT-R 모델은 지도 학습 전용 기준 대비 목표 성공 비율에서 27.7% 상승한 결과를 보였다.
  • 성공률 향상에도 불구하고 평균 대화 길이는 1.4턴에서 3.2턴으로 증가하여, 목표 달성을 위해 더 길고 전략적인 대화가 더 효과적임을 시사한다.
  • 인간 평가자들은 봇-플레이로 미세조정된 모델이 지도 학습 전용 모델보다 훨씬 더 일관되고 흥미로운 대화를 제공한다고 평가했다.
  • 인간의 구독자와 조합했을 때 봇-플레이 모델이 지도 학습 모델을 능가하여 인간의 선호도와 전략에 더 잘 부합함을 보였다.
  • 봇-플레이로 훈련된 모델는 인간의 구독자일지라도 선호도를 효과적으로 수집하고 정확한 추천을 제공하는 능력이 향상됨을 보였다.
  • 결과적으로 자기지도 학습 기반의 봇-플레이는 추천 작업에서 복잡한 목표 중심 대화 전략을 학습하는 데 효과적임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.