Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Reinforcement Learning based Group Recommender System

Zefang Liu, Shuran Wen|arXiv (Cornell University)|2021. 06. 13.
Recommender Systems and Techniques참고 문헌 17인용 수 4
한 줄 요약

이 논문은 딥 Q러닝 기반의 그룹 추천 시스템(DRGR)을 제안하며, 그룹 추천을 강화학습 기반의 마르코프 결정 과정(MDP)으로 모델링한다. 이는 딥 결정성 정책 기반 강화학습(DDPG)으로 훈련된 액터-크리틱 네트워크를 사용한다. DRGR는 MovieLens-Rand 데이터셋에서 GroupIM보다 리콜과 NDCG 지표에서 뛰어난 성능을 보였지만, 항목별 회원 상호작용를 충분히 모델링하지 못해 AGREE에 비해 열등한 성능을 보였다.

ABSTRACT

Group recommender systems are widely used in current web applications. In this paper, we propose a novel group recommender system based on the deep reinforcement learning. We introduce the MovieLens data at first and generate one random group dataset, MovieLens-Rand, from it. This randomly generated dataset is described and analyzed. We also present experimental settings and two state-of-art baselines, AGREE and GroupIM. The framework of our novel model, the Deep Reinforcement learning based Group Recommender system (DRGR), is proposed. Actor-critic networks are implemented with the deep deterministic policy gradient algorithm. The DRGR model is applied on the MovieLens-Rand dataset with two baselines. Compared with baselines, we conclude that DRGR performs better than GroupIM due to long interaction histories but worse than AGREE because of the self-attention mechanism. We express advantages and shortcomings of DRGR and also give future improvement directions at the end.

연구 동기 및 목표

  • 기존 그룹 추천 시스템의 동적 선호도 처리, 장기 보상 최적화, 추천 다양성 향상의 한계를 해결한다.
  • 현재 모델의 정적 성격을 극복하기 위해 강화학습을 활용해 그룹 추천을 순차적 의사결정 과정으로 모델링한다.
  • 그룹 선호도의 장기적 상호작용 역사와 시간적 동적 특성을 활용해 추천 품질을 향상시킨다.
  • 딥 러닝과 강화학습을 융합한 새로운 프레임워크를 도입하여 그룹 추천의 유연성과 성능을 향상시킨다.

제안 방법

  • 그룹 추천 작업을 마르코프 결정 과정(MDP)으로 설정하며, 그룹 회원 임베딩과 항목 상호작용 기반의 상태 공간과 행동 공간을 정의한다.
  • MDP에서 상태 전이와 보상을 생성하기 위해 행렬 분해를 사용한 환경 시뮬레이터를 구현한다.
  • 액터-크리틱 네트워크를 갖춘 에이전트를 설계한다: 액터는 행동 정책을 출력하고, 크리틱은 상태-행동 쌍의 Q값을 추정한다.
  • 경험 재생과 타겟 네트워크를 사용해 안정적인 학습을 위한 딥 결정성 정책 기반 강화학습(DDPG) 알고리즘으로 에이전트를 훈련시킨다.
  • 상태 임베딩 레이어에 자기주의 주의 메커니즘을 적용하여 그룹 회원 선호도를 집계하고, 회원 간 상대적 영향력을 포착한다.
  • MovieLens-Rand 데이터셋에서 모델을 종합적으로 최적화한다. 이는 MovieLens에서 유래한 무작위로 생성된 그룹 데이터셋이다.

실험 결과

연구 질문

  • RQ1딥 강화학습 프레임워크는 장기 보상을 고려한 순차적 의사결정 과정으로 그룹 추천을 효과적으로 모델링할 수 있는가?
  • RQ2DRGR는 AGREE와 GroupIM과 같은 최첨단 기준 모델 대비 리콜과 NDCG 지표에서 어떻게 성능을 내는가?
  • RQ3DRGR의 자기주의 주의 메커니즘이 그룹 회원 영향력을 얼마나 잘 포착하고 추천 품질을 향상시키는가?
  • RQ4DRGR는 GroupIM에 비해 성능이 뛰어나지만 AGREE에 비해 열등한 이유는 무엇이며, 이러한 격차를 초래하는 구조적 한계는 무엇인가?

주요 결과

  • DRGR는 모든 K 값(5, 10, 20)에서 GroupIM보다 높은 리콜과 NDCG 점수를 기록했으며, MovieLens-Rand 데이터셋에서 R@20는 0.5572, N@20는 0.2653을 기록했다.
  • DRGR는 AGREE에 비해 성능이 열등한 데, 이는 AGREE가 항목별 회원 영향력을 모델링하는 신경망 주의 메커니즘을 사용하기 때문이다.
  • DRGR와 AGREE 간의 성능 격차는 DRGR의 자기주의 주의가 특정 추천 목록의 항목과의 상호작용을 모델링하지 못하고 단지 그룹 회원 임베딩을 집계하기 때문이며, 이로 인해 발생한다.
  • DRGR는 상대적으로 높은 평균 그룹 평가 수(53.25)를 가진 MovieLens-Rand 환경에서 안정적이고 GroupIM보다 뛰어난 성능을 보여, 풍부한 상호작용 역사 처리 능력을 입증한다.
  • 사용자 및 항목 임베딩의 직접적인 공동 훈련에서의 불안정성은 성능이 최적화되지 않은 잠재적 원인으로 지적되었으며, 이는 아키텍처의 개선이 필요함을 시사한다.
  • 향후 향상 방안으로는 그룹-회원-항목 상호작용에 대한 주의 메커니즘 통합 또는 임베딩 집계를 위한 딥 세트(Deep Sets) 사용이 제안되어 있으며, 이는 모델의 민첩성과 성능 향상에 기여할 것으로 기대된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.