Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement learning based recommender systems: A survey

M. Mehdi Afsar, Trafford Crump|arXiv (Cornell University)|2021. 01. 15.
Recommender Systems and Techniques인용 수 8
한 줄 요약

이 종합 검토는 강화학습 기반 추천 시스템(RLRS)에 대해 포괄적인 개요를 제공하며, 전통적 강화학습과 딥 강화학습(DRL) 방법으로 분류한다. 네 구성 요소로 구성된 프레임워크—상태 표현, 정책 최적화, 보상 설계, 환경 구축—를 제안하고 핵심 알고리즘, 과제, 추세를 분석하며, DRL이 추천 시스템의 확장성과 장기적 사용자 참여도에 미친 변혁적 영향을 강조한다.

ABSTRACT

Recommender systems (RSs) have become an inseparable part of our everyday lives. They help us find our favorite items to purchase, our friends on social networks, and our favorite movies to watch. Traditionally, the recommendation problem was considered to be a classification or prediction problem, but it is now widely agreed that formulating it as a sequential decision problem can better reflect the user-system interaction. Therefore, it can be formulated as a Markov decision process (MDP) and be solved by reinforcement learning (RL) algorithms. Unlike traditional recommendation methods, including collaborative filtering and content-based filtering, RL is able to handle the sequential, dynamic user-system interaction and to take into account the long-term user engagement. Although the idea of using RL for recommendation is not new and has been around for about two decades, it was not very practical, mainly because of scalability problems of traditional RL algorithms. However, a new trend has emerged in the field since the introduction of deep reinforcement learning (DRL), which made it possible to apply RL to the recommendation problem with large state and action spaces. In this paper, a survey on reinforcement learning based recommender systems (RLRSs) is presented. Our aim is to present an outlook on the field and to provide the reader with a fairly complete knowledge of key concepts of the field. We first recognize and illustrate that RLRSs can be generally classified into RL- and DRL-based methods. Then, we propose an RLRS framework with four components, i.e., state representation, policy optimization, reward formulation, and environment building, and survey RLRS algorithms accordingly. We highlight emerging topics and depict important trends using various graphs and tables. Finally, we discuss important aspects and challenges that can be addressed in the future.

연구 동기 및 목표

  • 2018년 기준 강화학습 기반 추천 시스템(RLRS)에 대한 포괄적이고 최신의 개요를 제공하기 위해.
  • RLRS 방법을 강화학습 기반과 DRL 기반 접근으로 분류하여 딥러닝이 이끌어낸 전환을 부각하기 위해.
  • 체계적인 분석을 위한 구조화된 네 구성 요소 프레임워크(상태 표현, 정책 최적화, 보상 설계, 환경 구축)를 제안하기 위해.
  • 분야 특화 평가 지표 부족, 공개 데이터셋 제한, 코드 재현성 낮음 등의 주요 과제를 특정하기 위해.
  • 실험적 트렌드와 열린 문제를 제시하여 향후 연구를 이끌기 위해, 예를 들어 시뮬레이터 개발 및 알고리즘 선택 등

제안 방법

  • 상태 표현, 정책 최적화, 보상 설계, 환경 구축의 네 구성 요소로 구성된 RLRS 프레임워크를 제안한다.
  • 기존 RLRS 방법을 두 주요 범주로 분류한다: 전통적 RL 기반 및 딥 강화학습(DRL) 기반 방법.
  • 상태 표현 기법, 정책 학습 방법(예: Q-학습, DQN, PPO), 보상 형상화 전략을 중심으로 상세한 표와 비교 분석을 통해 RLRS 알고리즘을 분석한다.
  • 97篇의 종합 검토 논문을 대상으로 문헌학적 분석을 수행하여 출판 추세, 출판 장소 분포, 출판 유형(예: arXiv, 컫퍼런스, 저널)을 추적한다.
  • 평가 지표의 인기(예: 정밀도, 재현율), 일반적으로 사용되는 데이터셋(예: MovieLens), 코드 공유 비율 등의 지표를 사용하여 분야의 현황을 평가한다.
  • 표준화된 일반 목적의 시뮬레이션 환경이 RLRS에 필요하다고 제안한다. 이는 OpenAI Gym과 유사하며 재현성 향상과 오프라인 평가를 개선하기 위함이다.

실험 결과

연구 질문

  • RQ1딥 강화학습(DRL) 방법은 기존의 전통적 강화학습과 비교해 강화학습 기반 추천 시스템의 전반적인 환경을 어떻게 변화시켰는가?
  • RQ2강력한 RLRS 프레임워크의 핵심 구성 요소는 무엇이며, 이는 시스템 성능와 설계에 어떤 영향을 미치는가?
  • RQ3왜 RLRS에서는 분야 특화 평가 지표가 부족한가? 이는 모델 비교 및 벤치마킹에 어떤 영향을 미치는가?
  • RQ4RLRS 연구에서 재현성과 일반화에 대한 주요 과제는 무엇이며, 이를 어떻게 완화할 수 있는가?
  • RQ5공개 데이터셋과 시뮬레이션 환경은 RLRS 발전에 어떤 역할을 하는가? 향후 개선이 필요한 부분은 무엇인가?

주요 결과

  • 딥 강화학습(DRL)의 출현은 기존 전통적 RL의 확장성 한계를 극복하고 대규모 상태 공간과 행동 공간을 다룰 수 있는 확장 가능한 솔루션을 가능하게 하여 RLRS의 발전을 크게 이끌었다.
  • MovieLens은 RLRS 연구에서 가장 널리 사용되는 데이터셋이며, 연구자 약 16%만 자신의 구현 코드를 공유했는데, 이는 분야 내 재현성 수준이 낮음을 시사한다.
  • RLRS 전용 평가 지표가 부족하며, 대부분의 지표는 정보 검색 분야에서 유래한 것이며, 보상은 일반적으로 사용되지만 표준화되어 있지 않다.
  • 다른 도구들(예: Recogym, PyRecGym)이 등장하고 있음에도 불구하고, RLRS에 대한 통합된 일반 목적의 시뮬레이션 환경이 부족하여 벤치마킹 표준이 확립되어 있지 않다.
  • 2015년 이후 출판 추세가 증가하는 등 관심이 증가하고 있음에도 불구하고, RLRS는 여전히 초기 단계에 있으며 알고리즘 선택, 보상 설계, 환경 모델링 등의 중대한 과제를 안고 있다.
  • 특정 RL 알고리즘(예: Q-학습)이 RLRS 응용에서 다른 알고리즘보다 더 인기가 많은 이유를 이해하는 데 연구 격차가 있으며, 이는 알고리즘-응용 정합성에 대한 체계적 분석이 필요하다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.