[논문 리뷰] Offline Meta-level Model-based Reinforcement Learning Approach for Cold-Start Recommendation
이 논문은 추천 시스템에서 냉시작 사용자에게 빠른 적응을 가능하게 하는 오프라인 메타레벨 모델 기반 강화학습 프레임워크인 M3Rec를 제안한다. 최소한의 상호작용에서 사용자 정책과 보상 함수를 유추하기 위해 역강화학습을 활용하고 사용자 컨텍스트 변수를 학습함으로써, M3Rec는 샘플 효율성을 향상시키고, 새로운 사용자당 단일 상호작용 시퀀스로도 최신 기술 성능을 달성한다.
Reinforcement learning (RL) has shown great promise in optimizing long-term user interest in recommender systems. However, existing RL-based recommendation methods need a large number of interactions for each user to learn a robust recommendation policy. The challenge becomes more critical when recommending to new users who have a limited number of interactions. To that end, in this paper, we address the cold-start challenge in the RL-based recommender systems by proposing a meta-level model-based reinforcement learning approach for fast user adaptation. In our approach, we learn to infer each user's preference with a user context variable that enables recommendation systems to better adapt to new users with few interactions. To improve adaptation efficiency, we learn to recover the user policy and reward from only a few interactions via an inverse reinforcement learning method to assist a meta-level recommendation agent. Moreover, we model the interaction relationship between the user model and recommendation agent from an information-theoretic perspective. Empirical results show the effectiveness of the proposed method when adapting to new users with only a single interaction sequence. We further provide a theoretical analysis of the recommendation performance bound.
연구 동기 및 목표
- 새로운 사용자가 상호작용 이력이 부족한 강화학습 기반 시스템에서의 냉시작 추천 문제를 해결한다.
- 새로운 사용자당 몇 개의 상호작용만으로도 빠른 정책 적응을 가능하게 하여 샘플 효율성을 향상시킨다.
- 냉시작 사용자 간의 구조적 유사성을 학습하는 메타레벨 프레임워크를 개발하여 일반화 능력을 향상시킨다.
- 제한된 오프라인 데이터에서 사용자 정책과 보상 함수를 유추하기 위해 역강화학습을 통합한다.
- 사용자 및 추천 에이전트 간의 종속성을 정보이론적 상호정보 정규화를 통해 모델링한다.
제안 방법
- 희소한 상호작용 시퀀스에서 사용자 선호도를 표현하고 유추하기 위해 사용자 컨텍스트 변수를 도입한다.
- 소수의 사용자 상호작용에서 사용자 정책과 보상 함수를 복원하기 위해 역강화학습을 사용한다.
- 사용자 컨텍스트 변수에 조건화된 메타레벨 사용자 모델을 구축하여 사용자 행동을 시뮬레이션한다.
- 메타학습 프레임워크 내에서 모델 기반 강화학습을 사용해 장기적인 사용자 참여도를 최적화하는 메타레벨 추천 에이전트를 훈련한다.
- 사용자 정책과 추천 정책 간의 상호정보 정규화를 적용하여 그 상호의존성을 모델링하고 적응 능력을 향상시킨다.
- 메타학습을 위해 오프라인 데이터를 활용하고, 시뮬레이션 및 실제 오프라인 환경에서 성능을 평가한다.
실험 결과
연구 질문
- RQ1메타레벨 모델 기반 강화학습 접근법이 단일 상호작용 시퀀스로만 냉시작 사용자에게 효과적으로 적응할 수 있는가?
- RQ2역강화학습을 통합함으로써 냉시작 추천에서 샘플 효율성이 어떻게 향상되는가?
- RQ3사용자 정책과 추천 정책 간의 상호정보 정규화가 적응 성능 향상에 얼마나 기여하는가?
- RQ4제안된 방법은 온라인 및 오프라인 환경에서 최신 기술 기반 강화학습 및 메타학습 기반 추천 방법과 비교해 어떻게 성능을 냅니다?
- RQ5제안된 오프라인 메타강화학습 프레임워크의 이론적 성능 한계는 무엇인가?
주요 결과
- 온라인 시뮬레이션에서 M3Rec는 k=3일 때 40.72 ± 0.66, k=5일 때 40.80 ± 0.50의 평균 보상을 기록하여 모든 베이스라인을 압도했다.
- CIKM CUP 2016 데이터셋에서의 오프라인 평가에서 M3Rec는 1위치에서 정밀도 7.26%, 5위치에서 28.42%, 10위치에서 40.02%를 기록하여 모든 베이스라인을 크게 초월했다.
- M3Rec는 NDCG@5에서 17.89%, NDCG@10에서 21.63%를 기록하여 다음으로 우수한 방법보다 2个百分点 이상 높였다.
- Recall@10은 M3Rec가 9.16%를 기록하여 가장 우수한 베이스라인의 8.97%를 초월하여 관련 항목의 커버리지 향상을 입증했다.
- 이론적 분석을 통해 오프라인 메타강화학습 프레임워크의 성능 한계가 확인되었으며, 이는 일반화 능력을 뒷받침한다.
- 상호정보 정규화의 통합으로 냉시작 사용자에 대한 적응 속도와 정확도에서 측정 가능한 향상이 이루어졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.