Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarial Counterfactual Learning and Evaluation for Recommender System

Da Xu, Chuanwei Ruan|arXiv (Cornell University)|2020. 11. 07.
Recommender Systems and Techniques참고 문헌 47인용 수 14
한 줄 요약

이 논문은 추천 시스템에서 관측되지 않은 노출 메커니즘에 의해 혼동되는 피드백 데이터로 인해 발생하는 노출 편향을 해결하기 위해 새로운 미니맥스 적대적 역행 학습 프레임워크를 제안한다. 노출 메커니즘을 두 모델 간의 게임에서 적대자로 설정함으로써, 이 방법은 강인한 오프라인 학습과 평가를 가능하게 하며, 시뮬레이션과 실제 온라인 A/B 테스트 모두에서 표준 기준 모델보다 뛰어난 성능을 보이며, 특히 오프라인 평가 결과와 온라인 평가 결과 간의 괴리 현상을 완화하는 데에 효과적이다.

ABSTRACT

The feedback data of recommender systems are often subject to what was exposed to the users; however, most learning and evaluation methods do not account for the underlying exposure mechanism. We first show in theory that applying supervised learning to detect user preferences may end up with inconsistent results in the absence of exposure information. The counterfactual propensity-weighting approach from causal inference can account for the exposure mechanism; nevertheless, the partial-observation nature of the feedback data can cause identifiability issues. We propose a principled solution by introducing a minimax empirical risk formulation. We show that the relaxation of the dual problem can be converted to an adversarial game between two recommendation models, where the opponent of the candidate model characterizes the underlying exposure mechanism. We provide learning bounds and conduct extensive simulation studies to illustrate and justify the proposed approach over a broad range of recommendation settings, which shed insights on the various benefits of the proposed approach.

연구 동기 및 목표

  • 관측되지 않은 노출 메커니즘이 조건화된 피드백 데이터로 인해 발생하는 오프라인 추천 시스템 평가의 근본적 문제인 노출 편향을 해결한다.
  • 실제 피드백 데이터에서 노출 상태의 부분적 관측으로 인해 발생하는 역행 학습의 식별 불가 문제를 극복한다.
  • 알 수 없는 노출 메커니즘을 적대적 구성요소로 간주하여 강인성을 확보하는 원칙적인, 미니맥스 기반의 학습 프레임워크를 개발한다.
  • 딥 러닝 모델이 실세계 성능은 뛰어나지만 오프라인 메트릭에서는 성능이 떨어지는 경향이 있는, 오프라인 평가와 온라인 A/B 테스트 사이의 격차를 해소한다.
  • 합리적인 일반화 경계와 합성 및 실세계 데이터셋(온라인 A/B 실험 포함)에서의 실증적 검증을 제공한다.

제안 방법

  • 후보 모델이 가장 나쁜 상황의 노출 메커니즘 하에서도 잘 작동하도록 하기 위해, 역행 학습 문제를 미니맥스 최적화 문제로 공식화한다.
  • 이중성과 완화를 활용하여, 미니맥스 문제를 해석 가능한 두 모델 적대 게임으로 변환한다: 하나는 사용자 피드백을 예측하는 모델(f_θ), 다른 하나는 노출 메커니즘을 모델링하는 모델(g_ψ).
  • 피드백 예측과 노출 모델링 목표 간의 최적화 균형을 맞추기 위해 정규화 항 α를 도입한다.
  • 역행 학습 환경에서 우선도 가중치를 적용하지만, 노출 불확실성을 적대적으로 간주함으로써 식별 가능성 제약 조건을 완화한다.
  • g_ψ가 f_θ의 가장 나쁜 상황의 노출 적대자로 작용하도록, 두 모델을 번갈아가며 훈련함으로써 분포 이탈 상황에서도 일반화 능력을 향상시킨다.
  • 실세계 데이터셋(Movielens-1M, Last-FM, Goodreads)과 합성 시뮬레이션을 활용하여 다양한 노출 메커니즘과 모델 아키텍처 하에서 방법을 평가한다.

실험 결과

연구 질문

  • RQ1노출 메커니즘이 관측되지 않은 채로 무시될 경우, 피드백 데이터에 대한 지도 학습이 사용자 선호도 탐지에 일관성 없음을 초래할 수 있는가?
  • RQ2노출 편향이 오프라인 평가 메트릭을 얼마나 심각하게 왜곡하는가? 특히 이는 역사를 기반으로 한 노출 패턴에 의존할 경우에 더욱 그렇다.
  • RQ3미니맥스 공식화가 노출 메커니즘의 불확실성을 효과적으로 모델링하고 오프라인 모델 평가의 강인성을 향상시킬 수 있는가?
  • RQ4제안된 적대적 역행 프레임워크는 표준 우선도 기반 방법에 비해 일반화 능력과 온라인 A/B 테스트 결과와의 일치도에서 어떻게 성능을 냈는가?
  • RQ5은닉 요인 차원과 정규화 강도 α와 같은 하이퍼파라미터에 대해 이 방법의 민감도는 어떠한가?

주요 결과

  • 논문은 이론적으로 표준 지도 학습이 관측되지 않은 노출 메커니즘으로 인해 선호도 탐지에 일관성 없음을 입증한다.
  • 제안된 적대적 역행 학습 방법은 실세계 데이터셋에서 최고 성능을 기록했으며, ACL-Attention 모델을 사용할 경우 Movielens-1M와 Last-FM에서 Hit@10 점수 각각 83.64를 기록했다.
  • 온라인 A/B 테스트에서, 적대적 역행 학습 모델은 기준 모델보다 클릭스루율에서 뛰어난 성능을 보이며, 실세계 배포 결과와의 일치를 확인했다.
  • 민감도 분석 결과, 정규화 파라미터 α가 너무 작거나 너무 크지 않을 때 최적의 성능을 보였으며, 극단적인 값에서는 성능이 저하됨을 확인했다.
  • 더 큰 은닉 요인 차원은 항상 모델 성능 향상으로 이어졌으며, 이는 방법이 기반 추천 모델의 일반화 성질을 그대로 이어받음을 시사한다.
  • 이 방법은 오프라인 평가와 온라인 A/B 테스트 간의 괴리를 효과적으로 줄였으며, 딥 러닝 모델이 실세계에서는 성공적이지만 오프라인 메트릭에서는 성능이 떨어지는 역설을 해결했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.