Skip to main content
QUICK REVIEW

[論文レビュー] FuxiCTR: An Open Benchmark for Click-Through Rate Prediction

Jieming Zhu, Jinyang Liu|arXiv (Cornell University)|Sep 12, 2020
Recommender Systems and Techniques参考文献 38被引用数 7
ひとこと要約

FuxiCTR は、再現性のあるクリックスルー率(CTR)予測研究のためのオープンで標準化されたベンチマークであり、Criteo および Avazu データセットを用いて、24 つのディープラーニングモデルを 4,600 回の実験で評価する統一されたフレームワークを採用している。このベンチマークは、報告されたモデル性能に顕著な不一致を明らかにし、最先端モデルとの公平な比較を実現するためのきめ細やかな一貫性のある評価プロトコルの必要性を強調している。

ABSTRACT

In many applications, such as recommender systems, online advertising, and product search, click-through rate (CTR) prediction is a critical task, because its accuracy has a direct impact on both platform revenue and user experience. In recent years, with the prevalence of deep learning, CTR prediction has been widely studied in both academia and industry, resulting in an abundance of deep CTR models. Unfortunately, there is still a lack of a standardized benchmark and uniform evaluation protocols for CTR prediction. This leads to the non-reproducible and even inconsistent experimental results among these studies. In this paper, we present an open benchmark (namely FuxiCTR) for reproducible research and provide a rigorous comparison of different models for CTR prediction. Specifically, we ran over 4,600 experiments for a total of more than 12,000 GPU hours in a uniform framework to re-evaluate 24 existing models on two widely-used datasets, Criteo and Avazu. Surprisingly, our experiments show that many models have smaller differences than expected and sometimes are even inconsistent with what reported in the literature. We believe that our benchmark could not only allow researchers to gauge the effectiveness of new models conveniently, but also share some good practices to fairly compare with the state of the arts. We will release all the code and benchmark settings.

研究の動機と目的

  • CTR 予測研究における標準化されたベンチマークおよび一貫性のある評価プロトコルの不足に対処すること。
  • 深層 CTR モデル間で再現可能で一貫性のある実験結果を実現すること。
  • 既存の文献における報告された性能と実際のモデル性能の乖離を特定すること。
  • 最先端モデルとの公平な比較を可能にする統一されたフレームワークを提供すること。
  • CTR モデル性能の評価および報告におけるベストプラクティスを共有すること。

提案手法

  • Criteo および Avazu という2つの広く使われているデータセット上で、24 つの既存 CTR モデルを再評価するための統一されたディープラーニングフレームワークを開発した。
  • 一貫したトレーニングおよび評価条件を確保するため、12,000 グラフィックプロセッサ時間以上を要する 4,600 回以上の実験を実施した。
  • すべてのモデルに対して同一の前処理、ハイパーパramータ設定、評価指標を適用し、実装上のばらつきを排除した。
  • 標準化されたトレイン/バリデーション/テスト分割と交差検証プロトコルを用いて、公平性と再現性を確保した。
  • すべてのコード、モデル設定、ベンチマーク設定を公開し、透明性と再利用性を促進した。
  • 一貫した設定下でのモデルのロバストネスおよび一般化性能を評価するためのアブレーションスタディおよび感度分析を実施した。

実験結果

リサーチクエスチョン

  • RQ1統一されたトレーニングおよび評価プロトコルの下で再評価された場合、既存 CTR モデルの報告された性能向上はどの程度一貫しているか?
  • RQ2実装詳細の違いが CTR モデルの報告された性能にどの程度影響を及ぼすか?
  • RQ3CTR モデルの報告された最先端性能は、標準化されたベンチマーク条件下で再現可能か?
  • RQ4出版済み CTR モデル間で性能の不一致を引き起こす主な要因は何か?
  • RQ5標準化されたベンチマークは、CTR モデル評価における公平性と透明性を向上させることができるか?

主な発見

  • 多くの CTR モデルが、以前に報告されたものよりも顕著に小さい性能差を示したため、初期の主張の妥当性が疑問視された。
  • 同じプロトコルで再評価された際、多数のモデルが順位の不一致を示したため、報告バイアスまたは実装ばらつきの可能性が示唆された。
  • ベンチマークは、一部のモデルが「最先端」と報告されたが、同じハイパーパramータおよびデータ分割で評価された際には想定よりも劣る性能を示したことを明らかにした。
  • 結果は、信頼性があり比較可能なモデル比較を実現するための標準化された評価フレームワークの重要性を強調している。
  • コードおよび設定のオープンリリースにより、研究者が結果を検証し、今後の CTR モデル開発におけるベストプラクティスを採用できるようになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。