Skip to main content
QUICK REVIEW

[논문 리뷰] To Model or to Intervene: A Comparison of Counterfactual and Online Learning to Rank from User Interactions

Rolf Jagerman, Harrie Oosterhuis|arXiv (Cornell University)|2019. 07. 15.
Mobile Crowdsensing and Crowdsourcing참고 문헌 40인용 수 6
한 줄 요약

이 논문은 사용자 상호작용 데이터를 사용하여 반사적 학습과 온라인 학습-순서 매기기(LTR) 방법 간의 첫 번째 직접 비교를 제시한다. 낮은 편향, 낮은 노이즈 환경에서는 반사적 LTR가 온라인 LTR를 능가하지만, 높은 선택 편향, 위치 편향 또는 상호작용 노이즈가 존재할 경우 온라인 LTR가 더 견고하고 효과적이며, 초기 사용자 경험 악화에도 불구하고 그러한 환경에서 유의미한 성능 향상을 보인다.

ABSTRACT

Learning to Rank (LTR) from user interactions is challenging as user feedback often contains high levels of bias and noise. At the moment, two methodologies for dealing with bias prevail in the field of LTR: counterfactual methods that learn from historical data and model user behavior to deal with biases; and online methods that perform interventions to deal with bias but use no explicit user models. For practitioners the decision between either methodology is very important because of its direct impact on end users. Nevertheless, there has never been a direct comparison between these two approaches to unbiased LTR. In this study we provide the first benchmarking of both counterfactual and online LTR methods under different experimental conditions. Our results show that the choice between the methodologies is consequential and depends on the presence of selection bias, and the degree of position bias and interaction noise. In settings with little bias or noise counterfactual methods can obtain the highest ranking performance; however, in other circumstances their optimization can be detrimental to the user experience. Conversely, online methods are very robust to bias and noise but require control over the displayed rankings. Our findings confirm and contradict existing expectations on the impact of model-based and intervention-based methods in LTR, and allow practitioners to make an informed decision between the two methodologies.

연구 동기 및 목표

  • 실제 사용자 상호작용이 있는 환경에서 반사적 LTR와 온라인 LTR 방법론 간의 직접적 실증적 비교가 부족한 문제를 해결하기 위해.
  • 선택 편향, 위치 편향, 상호작용 노이즈가 반사적 LTR 및 온라인 LTR 방법의 성능에 미치는 영향을 조사하기 위해.
  • 시스템의 편향 및 노이즈 특성에 따라 반사적 LTR와 온라인 LTR를 선택하는 데 실무자들을 안내하기 위해.
  • 다양한 실험 조건 하에서 두 방법론의 견고성과 사용자 경험 영향을 평가하기 위해.
  • 모델 기반(반사적)과 간섭 기반(온라인) LTR 접근 방식 간의 선택 기준을 마련하기 위한 벤치마크 제공

제안 방법

  • 표준 벤치마크 데이터셋과 평가 지표를 사용하여 반사적 LTR(CLTR)와 온라인 LTR(OLTR) 방법 간의 종합적인 실증적 비교를 수행한다.
  • 선택 편향, 위치 편향, 상호작용 노이즈의 수준을 다양하게 조절한 제어된 실험 환경에서 CLTR와 OLTR 방법을 평가한다.
  • 생산 랭커를 기준선으로 삼고, 다양한 편향/노이즈 조건에서 모델 성능을 비교한다.
  • 정확한 성과 스코어를 기반으로 편향 제거를 수행하는 기존의 CLTR 방법을 적용하여 이상적인 조건 하에서 편향 없는 추정을 보장한다.
  • PDGD(정책 기울기 경사)와 같은 OLTR 방법을 사용하여 순서를 수정하고 탐색 및 성능 최적화를 위해 능동적으로 간섭한다.
  • 오프라인 지표를 사용해 두 방법을 평가하고, 특히 초기 성능 저하와 OLTR의 장기적 성과 향상에 주목하여 사용자 경험 변화를 시간 경과에 따라 추적한다.

실험 결과

연구 질문

  • RQ1반사적 LTR가 순서 매기기 성능 측면에서 온라인 LTR를 능가하는 조건는 무엇인가?
  • RQ2선택 편향이 존재할 경우 반사적 LTR와 온라인 LTR 방법의 상대적 성능에 어떤 영향을 미치는가?
  • RQ3상호작용 노이즈가 반사적 LTR 및 온라인 LTR 방법의 성능와 견고성에 어떤 영향을 미치는가?
  • RQ4위치 편향 수준이 각 방법론의 효과성에 어떻게 영향을 미치는가?
  • RQ5온라인 LTR는 초기에 사용자 경험을 얼마나 악화시키며, 얼마나 빨리 복구하거나 생산 랭커를 뛰어넘는가?

주요 결과

  • 낮은 선택 편향, 낮은 위치 편향, 최소한의 상호작용 노이즈가 존재하는 환경에서는 반사적 LTR가 가장 높은 성능을 기록한다.
  • 높은 선택 편향, 위치 편향 또는 상호작용 노이즈가 존재할 경우 온라인 LTR가 반사적 LTR를 일관되게 능가한다.
  • 높은 상호작용 노이즈가 존재할 경우 반사적 LTR는 이론적으로 편향이 없더라도 생산 랭커보다 성능이 떨어질 수 있다.
  • 온라인 LTR는 초기에 생산 랭커보다 열악한 사용자 경험을 제공하지만, 빠르게 개선되어 장기적으로 뛰어난 성과를 보인다.
  • 반사적 LTR의 모델 최적화 및 배포 사이클은 누적 노이즈 효과로 인해 성능 저하를 초래할 수 있다.
  • 온라인 LTR는 반사적 LTR보다 다양한 형태의 편향과 노이즈에 더 견고하여 현실적인 노이즈가 많은 생산 환경에서 더 바람직하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.