[논문 리뷰] CIRS: Bursting Filter Bubbles by Counterfactual Interactive Recommender System
이 논문은 인과 추론과 오프라인 강화 학습을 활용하여 내재된 관심사와 과도 노출 효과를 분리함으로써 사용자 만족도를 모델링하는 CIRS라는 반사적 상호작용 추천 시스템을 제안한다. 학습된 인과 사용자 모델을 통해 편향이 없는 반사적 보상을 생성함으로써 CIRS는 필터 버블을 효과적으로 줄이고 상호작용 추천 환경에서 장기적인 누적 만족도를 높인다.
While personalization increases the utility of recommender systems, it also brings the issue of filter bubbles. E.g., if the system keeps exposing and recommending the items that the user is interested in, it may also make the user feel bored and less satisfied. Existing work studies filter bubbles in static recommendation, where the effect of overexposure is hard to capture. In contrast, we believe it is more meaningful to study the issue in interactive recommendation and optimize long-term user satisfaction. Nevertheless, it is unrealistic to train the model online due to the high cost. As such, we have to leverage offline training data and disentangle the causal effect on user satisfaction. To achieve this goal, we propose a counterfactual interactive recommender system (CIRS) that augments offline reinforcement learning (offline RL) with causal inference. The basic idea is to first learn a causal user model on historical data to capture the overexposure effect of items on user satisfaction. It then uses the learned causal user model to help the planning of the RL policy. To conduct evaluation offline, we innovatively create an authentic RL environment (KuaiEnv) based on a real-world fully observed user rating dataset. The experiments show the effectiveness of CIRS in bursting filter bubbles and achieving long-term success in interactive recommendation. The implementation of CIRS is available via https://github.com/chongminggao/CIRS-codes.
연구 동기 및 목표
- 유사 콘텐츠에 대한 과도한 노출으로 시간이 지남에 따라 사용자 만족도가 감소하는 상호작용 추천 시스템에서 발생하는 필터 버블 문제를 해결한다.
- 과도 노출로 인한 동적 사용자 만족도 변화를 모델링하지 못하는 정적 및 순차적 추천 방법의 한계를 극복한다.
- 콘텐츠 과도 노출의 부정적 영향과 내재된 사용자 관심사를 분리함으로써 장기적 사용자 만족도를 최적화하는 방법을 개발한다.
- 실제 사용자 데이터에서 유도된 완전 관측 환경을 기반으로 현실적인 오프라인 평가 환경을 제공하여 상호작용 추천 정책의 신뢰성 있는 평가를 가능하게 한다.
- 즉각적인 만족도와 장기적 사용자 참여도를 균형 있게 조절할 수 있도록 강화 학습 정책을 이끄는 인과 프레임워크를 제공한다.
제안 방법
- 오프라인 강화 학습과 인과 추론을 융합하여 사용자 만족도를 모델링하는 반사적 상호작용 추천 시스템(CIRS)을 제안한다.
- 역사적 데이터에서 인과 사용자 모델을 학습하여 사용자 만족도에 미치는 과도 노출 효과를 추정하고, 내재된 관심사와 구분한다.
- 인과 사용자 모델을 활용해 다양한 노출 이력 하에서 사용자 만족도가 어떻게 변화할지 반영하는 반사적 보상을 생성한다.
- 반사적 보상을 오프라인 강화 학습 학습 과정에 통합하여 정책 학습이 장기적 만족도 극대화를 향해 유도되도록 한다.
- 실제로 운영된 추천 시스템의 완전 관측 사용자 평가 데이터 기반으로 현실적인 오프라인 강화 학습 환경인 KuaiEnv를 설계하고 공개한다.
- 시간 감쇠 함수를 사용하여 과도 노출 효과를 수식적으로 기술한다: 실제 노출에 대한 $e_t(u,i)$ 와 반사적 노출에 대한 $e_t^*(u,i)$ 를 정의하고, 감쇠 속도를 제어하는 하이퍼파라미터 $\tau$ 와 $\tau^*$ 를 사용한다.
실험 결과
연구 질문
- RQ1유사 아이템에 대한 과도 노출이 상호작용 추천 시스템에서 장기적인 사용자 만족도에 어떤 영향을 미치는가?
- RQ2인과 사용자 모델이 사용자 만족도에 미치는 과도 노출 효과와 내재된 관심사를 효과적으로 분리할 수 있는가?
- RQ3인과 추론에서 유도된 반사적 보상이 상호작용 추천에서 오프라인 강화 학습의 성능을 얼마나 향상시킬 수 있는가?
- RQ4CIRS는 필터 버블을 어떻게 줄이고 누적 만족도를 더 높이는가?
- RQ5제안된 KuaiEnv 환경은 상호작용 추천 정책의 신뢰성 있는 오프라인 평가에 적합한가?
주요 결과
- 유사 아이템에 대한 과도 노출은 사용자 관심과 관련된 아이템일지라도 시간이 지남에 따라 사용자 만족도를 크게 감소시키며, 이는 필터 버블의 존재와 영향력을 확인한다.
- CIRS는 과도 노출 모델링를 통해 단기 보상과 장기적 사용자 참여도를 효과적으로 균형 잡고, 누적 만족도 측면에서 베이스라인 방법을 능가한다.
- 제거 실험 결과, 인과 추론 구성 요소를 제거한 CIRS w/o CI는 성능이 열 劣화됨을 확인하여 반사적 보상의 필요성을 입증한다.
- 과도 노출 감쇠에 대한 최적의 하이퍼파라미터 조합 $\tau$ 와 $\tau^*$ 는 누적 만족도를 크게 향상시키며, 이는 이러한 파라미터의 민감성과 중요성을 보여준다.
- 제안된 KuaiEnv 환경은 완전 관측된 사용자 선호도를 제공함으로써 상호작용 추천 정책의 신뢰성 있는 오프라인 평가를 가능하게 한다.
- CIRS는 즉각적인 만족도와 지속적인 사용자 참여도 사이의 최적의 균형을 달성하여, 실제와 유사한 환경에서 필터 버블을 효과적으로 제거하는 것으로 확인된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.