Skip to main content
QUICK REVIEW

[논문 리뷰] FuxiCTR: An Open Benchmark for Click-Through Rate Prediction

Jieming Zhu, Jinyang Liu|arXiv (Cornell University)|2020. 09. 12.
Recommender Systems and Techniques참고 문헌 38인용 수 7
한 줄 요약

FuxiCTR는 재현 가능한 클릭-through 비율(CTR) 예측 연구를 위한 개방형 표준 기준 평가 기준이며, Criteo 및 Avazu 데이터셋을 사용하여 동일한 프레임워크로 4,600개 이상의 실험을 통해 24개의 딥러닝 모델을 평가한다. 이 기준 평가에서는 보고된 모델 성능 간의 상당한 이질성이 드러나며, 최신 기술 모델과의 공정한 비교를 보장하기 위해 철저하고 통일된 평가 프로토콜이 필요하다는 점을 시사한다.

ABSTRACT

In many applications, such as recommender systems, online advertising, and product search, click-through rate (CTR) prediction is a critical task, because its accuracy has a direct impact on both platform revenue and user experience. In recent years, with the prevalence of deep learning, CTR prediction has been widely studied in both academia and industry, resulting in an abundance of deep CTR models. Unfortunately, there is still a lack of a standardized benchmark and uniform evaluation protocols for CTR prediction. This leads to the non-reproducible and even inconsistent experimental results among these studies. In this paper, we present an open benchmark (namely FuxiCTR) for reproducible research and provide a rigorous comparison of different models for CTR prediction. Specifically, we ran over 4,600 experiments for a total of more than 12,000 GPU hours in a uniform framework to re-evaluate 24 existing models on two widely-used datasets, Criteo and Avazu. Surprisingly, our experiments show that many models have smaller differences than expected and sometimes are even inconsistent with what reported in the literature. We believe that our benchmark could not only allow researchers to gauge the effectiveness of new models conveniently, but also share some good practices to fairly compare with the state of the arts. We will release all the code and benchmark settings.

연구 동기 및 목표

  • CTR 예측 연구 분야에서 표준화된 벤치마크와 통일된 평가 프로토콜의 부족을 해결한다.
  • 딥 CTR 모델 간의 재현 가능하고 일관된 실험 결과를 확보한다.
  • 기존 문헌에서 보고된 성능과 실제 성능 간의 격차를 규명한다.
  • 최신 기술 모델과의 공정한 비교를 위한 통합 프레임워크를 제공한다.
  • CTR 모델 성능 평가 및 보고에 대한 최선의 실천 방안을 공유한다.

제안 방법

  • Criteo 및 Avazu라는 두 가지 널리 사용되는 데이터셋에서 기존 24개의 CTR 모델을 재평가하기 위해 통합된 딥러닝 프레임워크를 개발하였다.
  • 일致한 훈련 및 평가 조건을 확보하기 위해 12,000시간 이상의 GPU 시간을 소모한 4,600개 이상의 실험을 수행하였다.
  • 모든 모델에 동일한 전처리, 하이퍼파라미터 설정 및 평가 지표를 적용하여 구현 변동성을 제거하였다.
  • 표준화된 훈련/검증/테스트 분할 및 교차검증 프로토콜을 사용하여 공정성과 재현 가능성을 보장하였다.
  • 모든 코드, 모델 설정 및 벤치마크 설정을 공개하여 투명성과 재사용 가능성을 증진시켰다.
  • 균일한 설정 하에서 모델의 강건성과 일반화 능력을 평가하기 위해 아블레이션 연구 및 민감도 분석을 수행하였다.

실험 결과

연구 질문

  • RQ1동일한 훈련 및 평가 프로토콜 하에서 재평가할 경우, 기존 CTR 모델의 보고된 성능 향상은 얼마나 일관성 있는가?
  • RQ2구현 세부 사항의 차이가 CTR 모델의 보고된 성능에 얼마나 큰 영향을 미치는가?
  • RQ3CTR 모델의 보고된 최신 기술 성능 결과는 표준화된 벤치마크 조건에서 재현 가능한가?
  • RQ4공개된 CTR 모델 간 성능 이질성의 주요 원인은 무엇인가?
  • RQ5표준화된 벤치마크가 CTR 모델 평가의 공정성과 투명성 향상에 기여할 수 있는가?

주요 결과

  • 많은 CTR 모델에서 이전에 보고된 것보다 훨씬 작은 성능 차이가 나타나, 이전의 주장의 타당성을 도전한다.
  • 동일한 프로토콜 하에서 재평가했을 때, 상당수의 모델가 성능 순위가 일관되지 않게 나타나, 보고 편향 또는 구현 변동성의 가능성을 시사한다.
  • 벤치마크에서는 일부 모델이 동일한 하이퍼파라미터와 데이터 분할 조건에서 평가되었을 때, 보고된 최신 기술 성능을 달성하지 못하는 것으로 드러났다.
  • 이 결과는 신뢰할 수 있고 비교 가능한 모델 비교를 보장하기 위해 표준화된 평가 프레임워크의 중요성을 강조한다.
  • 코드 및 설정의 개방 공개를 통해 연구자들이 결과를 검증하고 향후 CTR 모델 개발을 위한 최선의 실천 방안을 채택할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.