[論文レビュー] FLEN: Leveraging Field for Scalable CTR Prediction
FLENは、CTR予測における相互フィールドおよび内部フィールド特徴相互作用を効率的にモデル化するフィールド別バイリニア相互作用プーリング機構を提案する。パラメータ数と推論遅延を著しく削減した。実産業データを用いたオフラインおよびオンラインA/Bテストにより、NFMよりも5.19%高いCTRを達成した。
Click-Through Rate (CTR) prediction has been an indispensable component for many industrial applications, such as recommendation systems and online advertising. CTR prediction systems are usually based on multi-field categorical features, i.e., every feature is categorical and belongs to one and only one field. Modeling feature conjunctions is crucial for CTR prediction accuracy. However, it requires a massive number of parameters to explicitly model all feature conjunctions, which is not scalable for real-world production systems. In this paper, we describe a novel Field-Leveraged Embedding Network (FLEN) which has been deployed in the commercial recommender system in Meitu and serves the main traffic. FLEN devises a field-wise bi-interaction pooling technique. By suitably exploiting field information, the field-wise bi-interaction pooling captures both inter-field and intra-field feature conjunctions with a small number of model parameters and an acceptable time complexity for industrial applications. We show that a variety of state-of-the-art CTR models can be expressed under this technique. Furthermore, we develop Dicefactor: a dropout technique to prevent independent latent features from co-adapting. Extensive experiments, including offline evaluations and online A/B testing on real production systems, demonstrate the effectiveness and efficiency of FLEN against the state-of-the-arts. Notably, FLEN has obtained 5.19% improvement on CTR with 1/6 of memory usage and computation time, compared to last version (i.e. NFM).
研究の動機と目的
- FFM や FwFM のような既存のフィールドに特化したCTRモデルが直面する、パラメータ数の2次関数的増加と高いメモリ使用量というスケーラビリティと効率性の制限を解消すること。
- モデルの複雑さを増さずに、相互フィールドおよび内部フィールドの両方の特徴相互作用を捉える、パラメータ効率的で低遅延なニューラルネットワーク層を設計すること。
- フィールドに特化したアーキテクチャ内でのFMモジュールにおける勾配の結合問題が性能を低下させることを是正すること。
- トレーニング中に独立した潜在特徴が共適応するのを防ぐために、独自のドロップアウト法であるDicefactorを開発すること。
- 実世界のプロダクションレコメンデーションシステムにおけるオフライン評価とオンラインA/Bテストを通じて、FLENの優位性を検証すること。
提案手法
- FLENは、フィールド固有の埋め込み行列を用いて、フィールド内およびフィールド間の特徴間の相互作用を計算するフィールド別バイリニア相互作用(FwBI)プーリングを導入する。
- FwBI層は、以下のバイリニア形式により相互作用を計算する:$ \mathbf{v}_{ij} = \mathbf{e}_i^T \mathbf{W}_{ij} \mathbf{e}_j $、ここで$ \mathbf{e}_i $ と $ \mathbf{e}_j $ はそれぞれフィールド $ i $ と $ j $ の埋め込みであり、$ \mathbf{W}_{ij} $ はフィールドペア固有の重み行列である。
- プールド表現から高次の非線形相互作用を学習するために、FwBIをマルチレイヤーパーセプトロン(MLP)と統合する。
- 潜在特徴の共適応を防ぎ、勾配の結合問題を緩和するために、トレーニング中に完全なバイリニアパスをランダムにドロップする、新しいドロップアウト技術であるDicefactorを導入する。
- FwBI層は古典的モデルを一般化するように設計されており、重み行列に特定の制約を課すことで、FM、MF、FwFMが特別なケースとして現れる。
- エポックの早期停止とL2正則化を用いた確率的勾配降下法により、産業用途向けの低遅延サービングを最適化して、エンドツーエンドでモデルを訓練する。
実験結果
リサーチクエスチョン
- RQ1フィールド別バイリニア相互作用プーリング層は、パラメータ数の増加を最小限に抑えつつ、相互フィールドおよび内部フィールドの両方の特徴相互作用を効果的にモデル化できるか?
- RQ2FLENのFwBI層は、FFM や FwFM のような既存のフィールドに特化したモデルと比較して、パラメータ効率性と推論速度の点で優れているか?
- RQ3Dicefactorドロップアウト法は、フィールドに特化したアーキテクチャ内のFMベースのモジュールにおける勾配の結合問題を効果的に緩和できるか?
- RQ4FLENは、NFM や他の最先端モデルと比較して、顕著に低いメモリ使用量と計算量で優れたCTR予測性能を達成できるか?
- RQ5FLENモデルは、実世界のプロダクション環境における制約下でも、安定的かつ顕著な改善をオンラインA/Bテストで維持できるか?
主な発見
- Meituのプロダクションプラットフォームで実施した7日間のオンラインA/Bテストにおいて、FLENはNFMベースのシステムと比較してCTRを5.19%相対的に向上させた。
- FLENはNFMベースラインの1/6にまでメモリ使用量と計算時間を削減し、産業用途へのスケーラビリティが顕著に優れていることを示した。
- Avazuデータセットでは、FLENがすべてのモデルの中で最高のAUCとLoglossを達成し、NFFM や他のSOTAモデルよりも収束が速かった。
- FwBI層は、テストされたすべてのモデルの中で最も少ないパラメータ数(4.94×10⁷パラメータ)を実現し、FFM や NFFM よりも効率性に優れていた。
- Dicefactorのハイパーパramータチューニングの結果、Avazuではβ=0.7、Meituではβ=0.8が最適なAUCとLoglossをもたらし、トレーニングの安定化に有効であることが確認された。
- Meituデータセットでは、FLENが1秒間に処理できるインスタンス数が最多であり、実世界のシステムにおける高い推論効率を裏付けた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。