[논문 리뷰] AliExpress Learning-To-Rank: Maximizing Online Model Performance without Going Online
이 논문은 전자상거래 랭킹 시스템에서 오프라인-온라인 성능 불일치 문제를 해결하기 위해 평가자-생성자 재순서정렬(EG-Rerank) 프레임워크를 제안한다. 문맥 인식 평가자 모델을 오프라인 데이터로 훈련시켜 온라인 성능을 예측하고, 강화학습을 통해 평가자 점수를 최적화하도록 생성자 모델을 훈련시킴으로써, 온라인 A/B 테스트에서 산업 기준 대비 전환율 2.22% 향상이라는 성과를 달성하였다. 이는 평가자 점수가 전통적인 오프라인 지표보다 실제 성능과 더 일치함을 보여주며, 실용적인 평가 기준이 될 수 있음을 시사한다.
Learning-to-rank (LTR) has become a key technology in E-commerce applications. Most existing LTR approaches follow a supervised learning paradigm from offline labeled data collected from the online system. However, it has been noticed that previous LTR models can have a good validation performance over offline validation data but have a poor online performance, and vice versa, which implies a possible large inconsistency between the offline and online evaluation. We investigate and confirm in this paper that such inconsistency exists and can have a significant impact on AliExpress Search. Reasons for the inconsistency include the ignorance of item context during the learning, and the offline data set is insufficient for learning the context. Therefore, this paper proposes an evaluator-generator framework for LTR with item context. The framework consists of an evaluator that generalizes to evaluate recommendations involving the context, and a generator that maximizes the evaluator score by reinforcement learning, and a discriminator that ensures the generalization of the evaluator. Extensive experiments in simulation environments and AliExpress Search online system show that, firstly, the classic data-based metrics on the offline dataset can show significant inconsistency with online performance, and can even be misleading. Secondly, the proposed evaluator score is significantly more consistent with the online performance than common ranking metrics. Finally, as the consequence, our method achieves a significant improvement ( extgreater$2\%$) in terms of Conversion Rate (CR) over the industrial-level fine-tuned model in online A/B tests.
연구 동기 및 목표
- 전자상거래 랭킹 모델에서 강한 오프라인 지표가 온라인 성능으로 이어지지 않는 지속적인 오프라인-온라인 불일치 문제를 해결하기 위해.
- 실제 온라인 사용자 행동을 반영하고, 특히 유인 효과와 같은 문맥 민감성 영향을 고려한 신뢰할 수 있는 오프라인 평가 지표를 개발하기 위해.
- 비용이 많이 드는 온라인 A/B 테스트 없이도 실제 목표인 전환율 최적화를 위한 랭킹 정책을 최적화하기 위해.
- 정적 오프라인 데이터에 과적합되지 않도록 일반화 가능한 평가자에 의해 이끌리는 강화학습을 통한 효과적인 재순서정렬을 가능하게 하기 위해.
제안 방법
- 프레임워크는 오프라인 데이터로 훈련된 평가자 모델을 도입하여, 순서가 정해진 항목 목록이 주어졌을 때 사용자의 구매 확률을 예측함으로써 문맥 효과(예: 유인 효과)를 반영한다.
- 생성자 모델은 강화학습을 통해 평가자 모델이 예측한 성능을 최대화하도록 훈련되며, 비그리디(비탐욕적)이고 창의적인 항목 순서를 탐색한다.
- 확률적 분류기(discriminator)는 평가자 모델의 일반화 능력을 향상시키기 위해 자기 신뢰도 점수를 제공함으로써, 분포 외 순서에 대해서도 안정성을 확보한다.
- 평가자 점수는 온라인 성능의 대체 지표로 기능하여, 온라인 배포 없이도 모델 선택 및 하이퍼파라미터 튜닝이 가능하다.
- 생성자 모델은 정책 그래디언트 방법을 사용하여 훈련되며, 보상 신호로 평가자 모델의 출력을 활용함으로써 복잡한 순열 공간 탐색이 가능하다.
- 프레임워크는 시뮬레이션과 AliExpress에서의 대규모 A/B 테스트를 통해 검증되었으며, 생산 환경 하에서 지연 시간과 성능을 모니터링하였다.
실험 결과
연구 질문
- RQ1기존의 오프라인 랭킹 지표(예: AUC, NDCG)가 전자상거래 랭킹에서 실제 온라인 성능과 얼마나 관련이 있는가?
- RQ2학습된 평가자 모델이, 특히 문맥 효과를 포함한 새로운 항목 순서에 대해 온라인 성능을 일반화하여 예측할 수 있는가?
- RQ3평가자에 의해 이끄는 강화학습을 통한 재순서정렬 모델 훈련이, 지도학습 기반 기준 대비 더 높은 온라인 전환율을 달성하는가?
- RQ4평가자 점수가 온라인 성능의 신뢰할 수 있는 대체 지표로 기능하여, 높은 비용이 드는 온라인 A/B 테스트 의존도를 줄일 수 있는가?
주요 결과
- 기존의 오프라인 지표인 온라인 GAUC는 실제 전환율과 상당한 불일치를 보이며, 한 전략은 GAUC가 가장 높음에도 불구하고 전환율이 8.45% 낮게 나타났다.
- 제안된 평가자 점수는 전통적 지표보다 실제 전환율과 훨씬 더 강한 상관관계를 보이며, 더 신뢰할 수 있는 오프라인 평가 대체 지표로 기능한다.
- EG-Rerank는 장기적인 A/B 테스트에서 산업 기준(RankNet*) 대비 전환율 2.22% 향상되었으며, p-value 0.011로 통계적으로 유의미하다.
- 프레임워크는 평균 지연 시간 115ms를 유지하였으며, 기준 대비 9ms 증가에 그쳐 실시간 시스템에 구현 가능한 것으로 확인되었다.
- 평가자 점수가 높은 정확도로 온라인 성능을 예측함을 입증하였으며, A/B 테스트에서 평가자 점수와 실제 전환율 격차 간의 강력한 일치가 확인되었다.
- EG-Rerank+는 전환율을 추가로 0.63% 향상시켜 제안된 프레임워크의 강건성과 확장성을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.