[논문 리뷰] Consistent Position Bias Estimation without Online Interventions for Learning-to-Rank
이 논문은 다수의 랭킹 함수로부터의 암시적 피드백을 이용하여 학습-랭킹에서 위치 편향을 간섭 없이 일관되게 추정하는 방법을 제안한다. 서로 다른 랭커들 사이의 간섭 쌍을 활용하고 클릭 행동을 최대우도추정(MLE)을 통해 모델링함으로써, 수동 레이블, 온라인 간섭, 또는 제한적인 관련성 가정 없이 통계적으로 일관된 적성 추정을 달성한다.
Presentation bias is one of the key challenges when learning from implicit feedback in search engines, as it confounds the relevance signal with uninformative signals due to position in the ranking, saliency, and other presentation factors. While it was recently shown how counterfactual learning-to-rank (LTR) approaches \cite{Joachims/etal/17a} can provably overcome presentation bias if observation propensities are known, it remains to show how to accurately estimate these propensities. In this paper, we propose the first method for producing consistent propensity estimates without manual relevance judgments, disruptive interventions, or restrictive relevance modeling assumptions. We merely require that we have implicit feedback data from multiple different ranking functions. Furthermore, we argue that our estimation technique applies to an extended class of Contextual Position-Based Propensity Models, where propensities not only depend on position but also on observable features of the query and document. Initial simulation studies confirm that the approach is scalable, accurate, and robust.
연구 동기 및 목표
- 암시적 피드백에 의존할 때 학습-랭킹에서 표현 편향 문제를 다루기.
- 수동 관련성 평가, 온라인 간섭, 또는 강력한 관련성 모델링 가정을 요구하는 기존 적성 추정 방법의 한계를 극복하기.
- 위치 기반 모델(PBM)과 그 확장인 문맥 기반 PBM(CPBM) 하에서 상대 적성 추정을 일관되게, 스케일러블하게 수행할 수 있는 방법 개발하기.
- 사용자 경험을 해치지 않으며 추가 온라인 실험을 요구하지 않고도 자연 발생하는 다수의 랭킹 함수 데이터를 활용하여 일관된 추정을 가능하게 하기.
제안 방법
- 랭킹 함수 간 결과 순서가 다름에 따라 발생하는 암시적 피드백 로그를 자연 간섭의 형태로 활용한다.
- 문서가 한 랭커에서 순위 $k$에 있고 다른 랭커에서 $k'$에 있는 경우를 고려하여 간섭 집합 $S_{k,k'}$를 정의한다. 이를 통해 클릭--through 행동을 비교할 수 있다.
- 간섭 쌍 전역에서 클릭 및 비클릭 이벤트를 모두 모델링하는 최대우도추정(MLE) 목적함수를 사용하여 상대 적성 $\hat{p}_k / \hat{p}_1$를 추정한다.
- 노출 정도의 차이를 반영하기 위해 가중 클릭률 $\hat{c}_k^{k,k'}$ 및 $\hat{\neg c}_k^{k,k'}$를 사용하여 데이터 효율성을 향상시킨다.
- MLE 목적함수를 다음과 같이 제안한다: $\sum_{k \neq k'} \hat{c}_k^{k,k'} \log(\hat{p}_k \hat{r}_{k,k'}) + \hat{\neg c}_k^{k,k'} \log(1 - \hat{p}_k \hat{r}_{k,k'})$, 여기서 $\hat{r}_{k,k'}$는 상대적 관련성 이동을 캡처한다.
- PBM 및 CPBM 모델 하에서 해당 추정치 $\hat{p}_k / \hat{p}_1$가 진정한 상대 적성의 일관된 추정자임을 증명한다.
실험 결과
연구 질문
- RQ1온라인 간섭이나 수동 관련성 애너테이션 없이도 일관된 적성 추정을 얻을 수 있는가?
- RQ2여러 랭킹 함수로부터의 데이터는 어떻게 활용하여 통계적으로 일관된 위치 편향 추정을 수행할 수 있는가?
- RQ3랭커들이 결과 순서에서 매우 유사하거나 다를 경우에도 방법이 강인한가?
- RQ4검색 쿼리 및 문서 특성에 따라 검토 확률이 달라지는 문맥 기반 PBM으로의 확장은 가능한가?
- RQ5실제 노이즈 모델과 다양한 수준의 랭커 겹침 하에서 방법의 성능은 어떠한가?
주요 결과
- 제안된 MLE 기반 방법은 온라인 간섭이나 수동 관련성 레이블 없이도 상대 적성 $\hat{p}_k / \hat{p}_1$의 일관된 추정을 달성한다.
- 로그된 데이터의 양이 증가할수록 추정 정확도가 향상되어 방법의 이론적 일관성 확인된다.
- 랭커들이 매우 유사하거나 다를 경우에도 방법은 강인하며, 극단적인 경우에만 중간 정도의 성능 저하가 발생한다.
- 클릭 데이터의 노이즈 수준이 다양하더라도 추정 오차가 낮게 유지되어 실제 클릭 모델에 대한 내성적 저항력을 보여준다.
- 각 (쿼리, 문서) 쌍이 다수의 간섭 집합에 기여할 수 있도록 하여 가능한 데이터를 모두 활용함으로써 자원 낭비를 방지한다.
- 메서드는 문맥 기반 PBM로 자연스럽게 확장되며, 검토 확률이 쿼리 및 문서의 관측 가능한 특성에 따라 달라지는 상황에서도 적용 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.