Skip to main content
QUICK REVIEW

[논문 리뷰] Offline Comparison of Ranking Functions using Randomized Data

Aman Agarwal, Xuanhui Wang|arXiv (Cornell University)|2018. 10. 11.
Advanced Bandit Algorithms Research참고 문헌 13인용 수 3
한 줄 요약

이 논문은 균일하게 랜덤화된 이력 상호작용 데이터를 사용하여 순위 함수의 오프라인 평가에서 데이터 효율성과 비교 민감도를 향상시키기 위해 Trunc-match와 Rand-interleaving 두 가지 방법을 제안한다. 순위 목록을 잘라내고 상호배치를 활용하여 두 모델을 동시에 비교함으로써, 이 방법들은 전통적인 Direct-match보다 질의 유지율과 통계적 검정력에서 뚜렷이 뛰어나며, 특히 Rand-interleaving는 성능 차이를 감지하는 데 가장 높은 민감도를 보인다.

ABSTRACT

Ranking functions return ranked lists of items, and users often interact with these items. How to evaluate ranking functions using historical interaction logs, also known as off-policy evaluation, is an important but challenging problem. The commonly used Inverse Propensity Scores (IPS) approaches work better for the single item case, but suffer from extremely low data efficiency for the ranked list case. In this paper, we study how to improve the data efficiency of IPS approaches in the offline comparison setting. We propose two approaches Trunc-match and Rand-interleaving for offline comparison using uniformly randomized data. We show that these methods can improve the data efficiency and also the comparison sensitivity based on one of the largest email search engines.

연구 동기 및 목표

  • 순위 목록의 오프라인 평가에서 Inverse Propensity Scores(IPS)의 낮은 데이터 효율성 문제를 해결하고자 하며, 특히 조합 폭발으로 인해 전체 목록 매칭이 불가능한 경우를 대비한다.
  • 포인트와치 메트릭 추정이 아닌 단지 쌍별 비교(어느 모델이 더 나은가)만 필요하다는 사실을 활용하여, 데이터 효율성과 비교 민감도를 향상시키고자 한다.
  • 이전에는 온라인 A/B 테스트에서만 사용된 상호배치(interleaving)를 균일하게 랜덤화된 데이터를 사용하여 오프라인 평가에 확장하고자 한다.
  • 랜덤화된 데이터를 특화된 매칭 및 상호배치 전략을 통해 오프라인 비교에 더 효과적으로 활용할 수 있음을 입증하고자 한다.

제안 방법

  • Trunc-match는 기록된 순위 목록을 상위-k 항목으로 잘라내어 비교 대상으로 삼음으로써 매칭 효율성을 향상시키며, 새로운 랭커의 상위-k 출력와 매칭될 가능성을 높인다.
  • 이 방법은 균일하게 랜덤화된 목록을 잘라내도 균일한 랜덤성 유지가 가능하다는 가정을 바탕으로, 잘라낸 부분집합에서 편향 없는 평가가 가능하다.
  • Rand-interleaving는 각 위치에서 두 경쟁 랭커의 최소 순위를 취하여 상호배치된 목록을 구성함으로써, 동일한 질의에서 두 모델의 상대적 성능을 직접 비교할 수 있도록 한다.
  • 이 접근법은 상호배치된 목록을 사용해 클릭률을 추정하며, 상호배치를 쌍별 비교의 형태로 간주함으로써 민감도를 향상시킨다.
  • 두 방법 모두 103만 개의 질의를 포함한 대규모 이메일 검색 엔진 데이터셋에 적용되었으며, 신뢰구간을 계산하고 통계적 유의성을 평가하기 위해 재표본추출을 사용하였다.
  • 평가에서는 Trunc-match와 Rand-interleaving를 기준선인 Direct-match와 비교하여 유지율, 평균 역순위(MRR@k), 클릭 수(에러 막대 포함)를 측정하였다.

실험 결과

연구 질문

  • RQ1랜덤화된 순위 목록을 잘라내는 것이 순위 함수의 오프라인 평가에서 데이터 효율성을 향상시킬 수 있는가?
  • RQ2단일 랜덤화된 목록에 두 순위 함수를 상호배치함으로써, 단일 모델 매칭 대비 비교 민감도가 향상되는가?
  • RQ3Trunc-match와 Rand-interleaving는 Direct-match 대비 질의 유지율과 성능 차이 감지에 있어 통계적 검정력 측면에서 어떻게 다른가?
  • RQ4완전한 목록 매칭이나 포인트와치 메트릭 추정 없이도 랜덤화된 데이터를 효과적으로 오프라인 비교에 활용할 수 있는가?

주요 결과

  • Trunc-match는 주어진 k에 대해 약 1/k!의 질의를 유지하며, 이는 이론적 기대와 일치하며 Direct-match의 낮은 유지율에 비해 뚜렷이 향상된다.
  • Rand-interleaving는 각 위치에서 두 모델 중 하나 이상의 상위-k 항목이 매칭될 가능성이 더 높기 때문에 Trunc-match보다 略히 더 많은 질의를 유지한다.
  • Direct-match는 k=1일 때조차도 오차 막대가 겹치며, 이는 낮은 데이터 효율성과 비교에 있어 낮은 통계적 검정력을 보여준다.
  • Trunc-match는 유지율과 비교 민감도 측면에서 Direct-match를 향상시키지만, Rand-interleaving는 평균과 표준오차 측면에서 두 랭커 간 분리도가 가장 뛰어나다.
  • 결과는 상호배치가 데이터 사용량 증가 외에도 성능 차이 감지 능력을 본질적으로 향상시킨다는 것을 확인한다.
  • 제안된 방법들은 103만 개의 질의를 포함한 실제 이메일 검색 환경에서 효과적이며, 대규모 오프라인 평가에 실용적인 유용성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.