Skip to main content
QUICK REVIEW

[논문 리뷰] Batch-Constrained Distributional Reinforcement Learning for Session-based Recommendation

D. Garg, Priyanka Gupta|arXiv (Cornell University)|2020. 12. 16.
Advanced Bandit Algorithms Research참고 문헌 47인용 수 9
한 줄 요약

이 논문은 온라인 상호작용이나 사용자 행동 모델 없이 오프라인 상호작용 로그에서만 학습하는 배치 제약이 부여된 분포 기반 강화학습 방법인 BCD4Rec을 제안한다. 분포 기반 RL과 행동 공간 제약, 사전 학습된 아이템 임베딩을 결합함으로써 BCD4Rec은 큰 행동 공간에서 과도한 추정 편향과 인기도 편향을 줄이며, 클릭률(CTR)과 구매률(BR) 측면에서 행동 정책과 강력한 기준 모델들을 뛰어넘는 성능을 보인다.

ABSTRACT

Most of the existing deep reinforcement learning (RL) approaches for session-based recommendations either rely on costly online interactions with real users, or rely on potentially biased rule-based or data-driven user-behavior models for learning. In this work, we instead focus on learning recommendation policies in the pure batch or offline setting, i.e. learning policies solely from offline historical interaction logs or batch data generated from an unknown and sub-optimal behavior policy, without further access to data from the real-world or user-behavior models. We propose BCD4Rec: Batch-Constrained Distributional RL for Session-based Recommendations. BCD4Rec builds upon the recent advances in batch (offline) RL and distributional RL to learn from offline logs while dealing with the intrinsically stochastic nature of rewards from the users due to varied latent interest preferences (environments). We demonstrate that BCD4Rec significantly improves upon the behavior policy as well as strong RL and non-RL baselines in the batch setting in terms of standard performance metrics like Click Through Rates or Buy Rates. Other useful properties of BCD4Rec include: i. recommending items from the correct latent categories indicating better value estimates despite large action space (of the order of number of items), and ii. overcoming popularity bias in clicked or bought items typically present in the offline logs.

연구 동기 및 목표

  • 온라인 및 모델 기반 강화학습의 한계를 해결하기 위해, 완전히 오프라인 상호작용 로그에서만 학습하는 방법을 제안한다.
  • 특히 보상이 희박한 큰 행동 공간에서 과도한 추정 편향과 인기도 편향을 완화한다.
  • 추가 사용자 상호작용이 필요 없이 열악한 행동 정책보다 우수한 성능을 보이는 강건한 오프라인 강화학습 프레임워크를 개발한다.
  • 분포 기반 강화학습과 행동 공간 제약이 가치 추정과 추천 다양성 향상에 얼마나 효과적인지 평가한다.
  • 배치 강화학습에서 하이퍼파라미터 튜닝을 위한 신뢰할 수 있는 오프라인 메트릭을 규명하며, 기존 Recall 기반 메트릭의 신뢰성에 도전한다.

제안 방법

  • BCD4Rec는 Q-값의 전체 분포를 모델링하기 위해 분포 기반 강화학습을 활용하여, 확률적 사용자 피드백에 대한 강건성 향상과 과도한 추정 편향 감소를 달성한다.
  • BCQ 스타일 정규화를 통해 배치 제약(예: 행동 정책의 지원 내 행동에 국한)을 적용함으로써 분포 이탈을 줄이고 샘플 효율성을 향상시킨다.
  • SRGNN를 통해 사전 학습된 아이템 임베딩을 사용하여 낮은 차원의 공간에서 아이템을 표현함으로써, 큰 행동 공간(예: 약 6.7천 개 아이템)에서 일반화 능력을 향상시킨다.
  • 오프라인 배치에서 검증 세트를 활용해 평균 Q-값 추정($\bar{Q}$)을 계산하며, 이는 온라인 성능 메트릭인 CTR와 BR와 강하게 상관됨을 입증한다.
  • 에이전트가 타당한 행동에 집중하도록 유도하는 제약이 부여된 행동 공간 학습을 통합함으로써, 관련성이 없는 아이템에 대한 잘못된 가치 추정을 줄인다.
  • 하이퍼파라미터 튜닝은 보류된 검증 세트에서의 $\bar{Q}$를 기반으로 하며, 이는 오프라인 메트릭 선택에서 표준 Recall@K보다 더 신뢰할 만한 것으로 경험적으로 확인되었다.

실험 결과

연구 질문

  • RQ1분포 기반 강화학습에 배치 제약을 적용하면, 오프라인 세션 기반 추천에서 표준 Q-학습보다 성능 향상이 이루어지는가?
  • RQ2BCD4Rec은 특히 관련성이 없는 아이템 카테고리의 행동에 대해 가치 추정에서 과도한 추정 편향을 줄이는가?
  • RQ3BCD4Rec은 특히 큰 행동 공간에서 오프라인 로그에 존재하는 인기도 편향을 얼마나 효과적으로 완화하는가?
  • RQ4하이퍼파라미터 선택에서 평균 Q-값 추정($\bar{Q}$)이 Recall@K보다 더 신뢰도가 높은가?
  • RQ5사전 학습된 아이템 임베딩은 배치 강화학습 하에서 고차원 행동 공간에서 성능 향상에 얼마나 기여하는가?

주요 결과

  • BCD4Rec은 실제 및 시뮬레이션 데이터셋에서 모두 행동 정책과 강력한 비-RL 및 RL 기준 모델보다 클릭률(CTR)과 구매률(BR)을 크게 향상시켰다.
  • 큰 행동 공간(약 6.7천 개 아이템)에서도 관련성이 없는 카테고리의 아이템에 대해 낮은 가치 추정을 정확히 할당함으로써 과도한 추정 편향을 줄였다.
  • DQN, BCQ, QRDQN보다 추천 아이템의 인기도 편향이 낮아져 온라인 에이전트 수준의 성능에 가까워졌다.
  • SRGNN를 통해 사전 학습된 아이템 임베딩을 활용하면, 특히 큰 행동 공간(예: DN 데이터셋)에서 성능 향상이 뚜렷하게 나타나, 배치 강화학습에서 표현 학습의 중요성을 입증한다.
  • 보류된 검증 세트에서의 평균 Q-값 추정($\bar{Q}$)은 온라인 CTR와 BR와 강하게 상관되며, 하이퍼파라미터 선택에서 일반적으로 사용되는 Recall@3 메트릭보다 우수한 성능을 보였다.
  • BCD4Rec는 BR와 CTR 모두에서 표준 DQN과 QRDQN을 능가했으며, 특히 더 큰 행동 공간에서 성능 향상이 두드러져, 오프라인 환경에서 분포 학습과 제약의 이점이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.