Skip to main content
QUICK REVIEW

[논문 리뷰] A Simple yet Effective Framework for Active Learning to Rank

Qingzhong Wang, Haifang Li|arXiv (Cornell University)|2022. 05. 20.
Machine Learning and Algorithms참고 문헌 52인용 수 4
한 줄 요약

이 논문은 웹 검색에서 랭킹 학습(LTR)을 위한 단순하면서도 효과적인 주동 학습 프레임워크를 제안한다. 이 프레임워크는 낮은 빈도의 쿼리에 대한 불확실성을 식별하기 위해 랭킹 엔트로피(RE)를, 고빈도 쿼리의 높은 다양성을 우선시하기 위해 예측 분산(PV)을 결합한다. 하이브리드 RE+PV 전략은 동일한 레이블링 예산 하에서 DCG 기준 최대 1.38% 향상으로 LTR 모델 성능을 향상시키며, 바이두의 검색 엔진에서 대규모로도 효율적인 훈련을 가능하게 하면서 레이블링 비용을 절감한다.

ABSTRACT

While China has become the biggest online market in the world with around 1 billion internet users, Baidu runs the world largest Chinese search engine serving more than hundreds of millions of daily active users and responding billions queries per day. To handle the diverse query requests from users at web-scale, Baidu has done tremendous efforts in understanding users' queries, retrieve relevant contents from a pool of trillions of webpages, and rank the most relevant webpages on the top of results. Among these components used in Baidu search, learning to rank (LTR) plays a critical role and we need to timely label an extremely large number of queries together with relevant webpages to train and update the online LTR models. To reduce the costs and time consumption of queries/webpages labeling, we study the problem of Activ Learning to Rank (active LTR) that selects unlabeled queries for annotation and training in this work. Specifically, we first investigate the criterion -- Ranking Entropy (RE) characterizing the entropy of relevant webpages under a query produced by a sequence of online LTR models updated by different checkpoints, using a Query-By-Committee (QBC) method. Then, we explore a new criterion namely Prediction Variances (PV) that measures the variance of prediction results for all relevant webpages under a query. Our empirical studies find that RE may favor low-frequency queries from the pool for labeling while PV prioritizing high-frequency queries more. Finally, we combine these two complementary criteria as the sample selection strategies for active learning. Extensive experiments with comparisons to baseline algorithms show that the proposed approach could train LTR models achieving higher Discounted Cumulative Gain (i.e., the relative improvement ΔDCG4=1.38%) with the same budgeted labeling efforts.

연구 동기 및 목표

  • 대규모 웹 검색에서 수많은 쿼리-웹페이지 쌍의 레이블링에 소요되는 높은 비용과 시간을 줄이기 위해, 주동 학습을 위해 가장 정보가 많은 샘플을 선택하는 것.
  • 바이두 검색 환경에서 훈련 신호가 부족한 탓에 불확실성 기반 주동 학습이 낮은 빈도 쿼리에 편향되는 문제를 해결하기 위한 것.
  • 보완적인 기준을 통해 정보 수확량이 가장 큰 쿼리를 식별함으로써 LTR 모델 훈련 효율성을 향상시키기 위한 것.
  • 하루에 수억 개의 쿼리에 대해 실시간 배포에 적합한 확장성 있고 경량의 선택 전략을 개발하기 위한 것.
  • 제약된 레이블링 예산 하에서 불확실성(RE)과 다양성(PV) 기준을 조합함으로써 랭킹 성능 향상 여부를 검증하기 위한 것.

제안 방법

  • 프레임워크는 랭킹 엔트로피(RE)를 사용하여 다수의 모델 체크포인트에 걸쳐 질의-통합(질의 기반 결정) 방법(QBC)을 적용함으로써 LTR 예측의 불확실성을 측정하며, 일관되지 않은 랭킹 출력을 보이는 쿼리를 식별한다.
  • 예측 분산(PV)은 쿼리에 대해 관련 웹페이지의 예측 랭킹 점수의 다양성을 정량화하는 새로운 기준으로, 진정한 랭킹 다양성의 대체 지표로 기능한다.
  • RE와 PV는 탐색(불확실한 낮은 빈도 쿼리)과 이용(정보가 풍부한 고빈도 쿼리)의 균형을 이루기 위해 하이브리드 선택 전략으로 통합된다.
  • 모델의 불확실성과 랭킹 다양성을 모두 우선시하기 위해, 높은 통합 RE+PV 점수를 가진 쿼리를 선택하여 레이블링 대상으로 선정한다.
  • 이 방법은 바이두의 생산 검색 시스템에 구현되었으며, 매일 모델 업데이트와 0.6%의 트래픽에 대한 온라인 A/B 테스트를 통해 실제 환경 성능을 평가한다.
  • 오프라인 실험은 지표 데이터를 기반으로 DCG와 R01 향상을 계산하고, 온라인 실험은 실제 트래픽 메트릭을 사용해 RE+PV를 무작위 선택과 비교한다.

실험 결과

연구 질문

  • RQ1실제 웹 검색 환경에서 랭킹 엔트로피(RE)가 주동 학습을 위한 정보가 많은 쿼리를 식별하는 데 얼마나 효과적인가? 또 이러한 환경에서 어떤 편향을 유발하는가?
  • RQ2예측 분산(PV)이 진정한 랭킹 점수의 다양성을 효과적으로 캡처하고, 정보 수확량의 신뢰할 수 있는 대체 지표로 기능할 수 있는가?
  • RQ3RE와 PV를 조합함으로써 단일 기준 또는 무작위 선택 대비 LTR 모델 성능이 얼마나 향상되는가?
  • RQ4하이브리드 RE+PV 전략은 대규모 웹 검색 시스템에서 레이블링 비용을 줄이면서도 랭킹 품질을 유지하거나 향상시키는가?
  • RQ5낮은 빈도 쿼리, 즉 보통 감독 신호가 부족해 훈련이 어려운 쿼리에 대해 제안된 방법은 어떻게 성능을 발휘하는가?

주요 결과

  • 랭킹 엔트로피(RE)만을 사용할 경우, 훈련 신호가 부족한 탓에 낮은 빈도 쿼리에 편향되며, 정보 수확량이 제한된 채로도 높은 불확실성 점수를 기록한다.
  • 예측 분산(PV)은 웹페이지 간 랭킹 점수의 진정한 다양성과 강하게 상관되며, 정보 수확량의 효과적인 대체 지표로 기능하여 고빈도, 고다양성 쿼리를 선호한다.
  • 통합된 RE+PV 전략은 동일한 레이블링 예산 하에서 오프라인 실험에서 DCG@4 기준 최대 1.38% 향상, 온라인 실험에선 0.35% 향상 달성하며 무작위 선택 대비 성능 향상을 입증했다.
  • 제안된 방법은 무작위 선택 대비 유효한 훈련 쌍을 43% 더 많이 발견하여 훈련 효율성과 모델 일반화 능력을 크게 향상시켰다.
  • 온라인 결과에서는 일관된 성능 향상이 나타났다: 전체 쿼리에서 DCG@4는 최대 0.35% 향상되었고, 낮은 빈도 쿼리에선 최대 0.85% 향상되었으며, R01은 낮은 빈도 쿼리에서 최대 2.6% 감소하여 상위 결과의 관련성 향상을 시사한다.
  • 이 프레임워크는 실용적이고 확장 가능하여 실제 환경에 구현 가능하며, 수억 개의 쿼리가 포함된 풀에서 매일 모델 업데이트를 수행하면서도 최소한의 계산 오버헤드를 유발한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.