Skip to main content
QUICK REVIEW

[논문 리뷰] Toward Building Conversational Recommender Systems: A Contextual Bandit Approach

Xiaoying Zhang, Hong Xie|arXiv (Cornell University)|2019. 06. 04.
Advanced Bandit Algorithms Research인용 수 7
한 줄 요약

이 논문은 행동 피드백(예: 클릭) 외에도 사용자가 제공하는 언어적 피드백(사용자 관심사)을 통합하여 컨텍스트 밴딧을 개선하는 대화형 추천 시스템을 제안한다. 새로운 UCB 기반 알고리즘을 통해 탐색을 줄이고 학습 속도를 가속화한다. 합성 데이터, Yelp, Toutiao 뉴스 데이터를 대상으로 한 실험을 통해 본 방법이 학습 속도와 추천 성능 향상을 확인하였다.

ABSTRACT

Contextual bandit algorithms have gained increasing popularity in recommender systems, because they can learn to adapt recommendations by making exploration-exploitation trade-off. Recommender systems equipped with traditional contextual bandit algorithms are usually trained with behavioral feedback (e.g., clicks) from users on items. The learning speed can be slow because behavioral feedback by nature does not carry sufficient information. As a result, extensive exploration has to be performed. To address the problem, we propose conversational recommendation in which the system occasionally asks questions to the user about her interest. We first generalize contextual bandit to leverage not only behavioral feedback (arm-level feedback), but also verbal feedback (users' interest on categories, topics, etc.). We then propose a new UCB- based algorithm, and theoretically prove that the new algorithm can indeed reduce the amount of exploration in learning. We also design several strategies for asking questions to further optimize the speed of learning. Experiments on synthetic data, Yelp data, and news recommendation data from Toutiao demonstrate the efficacy of the proposed algorithm.

연구 동기 및 목표

  • 부족한 행동 피드백으로 인해 기존 컨텍스트 밴딧 추천 시스템의 학습 속도가 느려지는 문제를 해결하기 위해.
  • 사용자가 제공하는 언어적 피드백(예: 주제나 카테고리에 대한 관심사)을 학습 과정에 통합하여 추천 효율을 향상시키기 위해.
  • 행동 수준(행동 피드백)과 사용자 수준(언어적 피드백)의 이중 피드백을 활용하는 새로운 UCB 기반 알고리즘을 설계하여 수렴 속도를 향상시키기 위해.
  • 상호작용 중에 정보성 있는 사용자 피드백을 확보하기 위해 최적의 질문 제안 전략을 개발하기 위해.
  • Yelp 및 Toutiao 뉴스 데이터를 포함한 다양한 실세계 데이터셋에서 제안된 방법의 실증적 검증을 수행하기 위해.

제안 방법

  • 행동 피드백(예: 클릭)과 언어적 피드백(예: 사용자가 관심을 표현하는 문장)을 모두 통합하는 컨텍스트 밴딧 프레임워크를 일반화한다.
  • 행동 피드백과 언어적 피드백을 모두 활용하여 탐색과 이용의 균형을 동적으로 조정하는 새로운 UCB 기반 알고리즘을 제안한다. 이를 통해 광범위한 탐색이 필요로 하는 상황을 줄인다.
  • 사용자의 관심사에 대해 카테고리나 주제에 관해 질문을 주도적으로 제기하여 정보성 있는 피드백을 유도하는 질의 전략을 설계한다.
  • 사용자 피드백을 사이드 인포메이션 형태로 모델링하여 컨텍스트 벡터를 풍부화하고, 정책 학습을 향상시키며 추천의 불확실성을 감소시킨다.
  • 피드백을 상한 신뢰도 계산에 통합하여 예상 수익이 높고 불확실성이 낮은 행동을 우선순위로 배정한다.
  • 질문의 시기와 내용을 최적화하여 정보 수득을 극대화하면서도 사용자 부담을 최소화한다.

실험 결과

연구 질문

  • RQ1사용자로부터의 언어적 피드백을 컨텍스트 밴딧 프레임워크에 통합함으로써 효과적인 추천 학습을 위한 탐색의 양을 크게 줄일 수 있는가?
  • RQ2이중 피드백을 활용하는 제안된 UCB 기반 알고리즘이 기존 컨텍스트 밴딧 방법에 비해 학습 속도와 추천 정확도 측면에서 어떻게 비교되는가?
  • RQ3사용자 경험을 저해하지 않으면서도 가장 효과적인 피드백 확보를 위한 질문 제안 전략은 무엇인가?
  • RQ4사용자가 제공하는 관심 정보의 통합이 추천 시스템의 샘플 효율성에 얼마나 기여하는가?
  • RQ5본 방법은 뉴스 추천 및 지역 사업자 추천을 포함한 다양한 추천 시나리오에 대해 얼마나 강건한가?

주요 결과

  • 제안된 알고리즘은 정보성 있는 언어적 피드백을 활용하여 탐색을 줄여 기존 컨텍스트 밴딧보다 더 빠른 수렴을 이끌어낸다.
  • 합성 데이터를 대상으로 한 실험에서 이중 피드백 접근법이 상호작용 수를 줄이며 더 빠른 학습을 달성함을 확인하였다.
  • Yelp 데이터에서 본 방법은 사용자가 제공한 관심 신호를 효과적으로 활용하여 추천 성능을 향상시켰다.
  • Toutiao 뉴스 추천 데이터셋에서는 타겟팅된 질문 제안 전략을 통해 샘플 효율성이 향상됨을 보였다.
  • 언어적 피드백의 통합은 행동 신호가 흐리게 드러나는 저피드백 환경에서 학습 속도 향상에 특히 뚜렷한 영향을 미쳤다.
  • 최적의 질문 제안 전략은 정보 수득을 극대화하면서도 사용자 참여도를 유지하는 데 기여하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.