[論文レビュー] DADNN: Multi-Scene CTR Prediction via Domain-Aware Deep Neural Network
本稿では、共通表現学習のための共有ボトムブロックと、シーン固有の特徴を捉えるドメイン特化型ヘッドを備えた、マルチシーンCTR予測向けのドメインに配慮した深層ニューラルネットワーク(DADNN)を提案する。共有特徴と特徴的特徴の学習に知識移譲とMMoEを統合することで、オンラインA/Bテストにおいて、よくチューニングされたDCNモデルと比較してCTRが最大6.7%向上し、CPMが3.0%向上する一方で、複数のシーンにわたる単一モデルアーキテクチャにより、トレーニングおよびサービングコストを削減する。
Click through rate(CTR) prediction is a core task in advertising systems. The booming e-commerce business in our company, results in a growing number of scenes. Most of them are so-called long-tail scenes, which means that the traffic of a single scene is limited, but the overall traffic is considerable. Typical studies mainly focus on serving a single scene with a well designed model. However, this method brings excessive resource consumption both on offline training and online serving. Besides, simply training a single model with data from multiple scenes ignores the characteristics of their own. To address these challenges, we propose a novel but practical model named Domain-Aware Deep Neural Network(DADNN) by serving multiple scenes with only one model. Specifically, shared bottom block among all scenes is applied to learn a common representation, while domain-specific heads maintain the characteristics of every scene. Besides, knowledge transfer is introduced to enhance the opportunity of knowledge sharing among different scenes. In this paper, we study two instances of DADNN where its shared bottom block is multilayer perceptron(MLP) and Multi-gate Mixture-of-Experts(MMoE) respectively, for which we denote as DADNN-MLP and DADNN-MMoE.Comprehensive offline experiments on a real production dataset from our company show that DADNN outperforms several state-of-the-art methods for multi-scene CTR prediction. Extensive online A/B tests reveal that DADNN-MLP contributes up to 6.7% CTR and 3.0% CPM(Cost Per Mille) promotion compared with a well-engineered DCN model. Furthermore, DADNN-MMoE outperforms DADNN-MLP with a relative improvement of 2.2% and 2.7% on CTR and CPM respectively. More importantly, DADNN utilizes a single model for multiple scenes which saves a lot of offline training and online serving resources.
研究の動機と目的
- 数百の低トラフィックで長尾な電子商取引広告シーンに対して、高いリソースコストとデータ不足のため、個別にモデルをトレーニングする課題に対処すること。
- 統一されたモデルフレームワーク内で共有表現とシーン固有の表現を学習することで、マルチシーンCTR予測におけるドメインシフトを軽減すること。
- 外部の教師ネットワークを用いずに、シーン間の知識移譲を通じて、データが不足するシーンにおけるモデルの汎化性能とパフォーマンスを向上させること。
- 複数のシーンにわたるスケーラブルかつリソース効率の良い単一モデルのデプロイを可能とし、継続的に新しいシーンを追加できること。
- MMoEがCTR予測において、シーン間の共通性と差異を明示的にモデル化する有効性を調査すること。
提案手法
- DADNNは、複数のシーンのデータを統合して学習するため、すべてのシーンに共通するボトムブロックを採用し、汎用的で移譲可能な表現を学習する。
- 各シーンには、ドメイン特化型ヘッドが設けられ、特徴的特徴を学習することでドメインシフトを軽減し、シーンに配慮した予測を可能にする。
- 知識移譲は、シーン間での知識共有を促進する損失関数により実装され、特にデータが少ないシーンに恩恵をもたらす。
- 本モデルは2つのバージョンをサポートする:DADNN-MLP(多層パーセプトロンを共有ブロックとして使用)、およびDADNN-MMoE(より優れた表現学習を実現するためのマルチゲート混合エキスパートモジュールを採用)。
- MMoEはエキスパートごとにゲート重みを動的に割り当てることで、パrameter増加を最小限に抑えながら、共有特徴とシーン固有特徴の両方を学習可能にする。
- 大規模なシーンからの事前学習済み埋め込み層を用いてモデルパラメータを初期化することで、収束性とパフォーマンスが向上する。
実験結果
リサーチクエスチョン
- RQ1個別にモデルをトレーニングせずに、1つのディープラーニングモデルが、多数の低トラフィックで長尾な広告シーンを効果的に処理できるか。
- RQ2CTR予測において、シーン固有の特徴を保持しつつ、シーン間のドメインシフトをどのように軽減できるか。
- RQ3特にデータが不足する状況下で、シーン間の知識移譲がパフォーマンスにどの程度向上効果をもたらすか。
- RQ4MMoEモジュールが、シーン間の共通表現と固有表現の両方を明示的にモデル化することで、パフォーマンスを向上させるか。
- RQ5統一されたモデルアーキテクチャが、最小限の再トレーニングや再構成で、新しいシーンへの効率的かつスケーラブルな対応を可能にするか。
主な発見
- DADNN-MLPは、オンラインA/Bテストにおいて、よくチューニングされたDCNモデルと比較して、CTRが最大6.7%向上し、CPMが3.0%向上した。
- DADNN-MMoEは、DADNN-MLPよりもCTRで2.2%、CPMで2.7%高いパフォーマンスを示し、共有特徴とシーン固有特徴の明示的モデリングの利点を裏付けた。
- 知識移譲により、特にデータが少ないシーンで、シーン間の知識共有が強化され、モデルパフォーマンスが向上した。
- アブレーションスタディの結果、知識移譲とMMoEモジュールを併用することで最良のパフォーマンスが得られ、ベースモデル比で0.635%の絶対GAUC向上を達成した。
- MMoEモジュールでは、エキスパート数が2つを超過すると効果の増加が鈍り、複雑さとパフォーマンスの最適なトレードオフが示された。
- 1つのモデルで全シーンをカバーすることで、顕著なパフォーマンス向上を達成した一方で、オフライントレーニングおよびオンラインサービングコストを大幅に削減した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。