[論文レビュー] FedCTR: Federated Native Ad CTR Prediction with Multi-Platform User Behavior Data
FedCTRは、中央集権的なデータストレージを必要とせず、複数プラットフォームの行動データからユーザーの関心を統合的にモデリングすることで、プライバシーを守ったフェデレーテッドラーニングフレームワークを提示する。プラットフォームレベルの埋め込み表現に対して局所的微分プライバシー(LDP)を、集約された埋め込み表現に対して微分プライバシー(DP)を適用し、限られたプラットフォーム内行動データでも最先端の性能を達成しながら、ユーザーのプライバシーを効果的に保護する。
Native ad is a popular type of online advertisement which has similar forms with the native content displayed on websites. Native ad CTR prediction is useful for improving user experience and platform revenue. However, it is challenging due to the lack of explicit user intent, and users' behaviors on the platform with native ads may not be sufficient to infer their interest in ads. Fortunately, user behaviors exist on many online platforms and they can provide complementary information for user interest mining. Thus, leveraging multi-platform user behaviors is useful for native ad CTR prediction. However, user behaviors are highly privacy-sensitive and the behavior data on different platforms cannot be directly aggregated due to user privacy concerns and data protection regulations like GDPR. Existing CTR prediction methods usually require centralized storage of user behavior data for user modeling and cannot be directly applied to the CTR prediction task with multi-platform user behaviors. In this paper, we propose a federated native ad CTR prediction method named FedCTR, which can learn user interest representations from their behaviors on multiple platforms in a privacy-preserving way. On each platform a local user model is used to learn user embeddings from the local user behaviors on that platform. The local user embeddings from different platforms are uploaded to a server for aggregation, and the aggregated user embeddings are sent to the ad platform for CTR prediction. Besides, we apply LDP and DP techniques to the local and aggregated user embeddings respectively for better privacy protection. Moreover, we propose a federated framework for model training with distributed models and user behaviors. Extensive experiments on real-world dataset show that FedCTR can effectively leverage multi-platform user behaviors for native ad CTR prediction in a privacy-preserving manner.
研究の動機と目的
- プラットフォーム内行動データが不足している状況で、明示的なユーザーの意図が欠如しているため、ネイティブ広告のCTR予測精度が低くなるという課題に対処すること。
- GDPRなどのプライバシー規制を尊重しながら、中央集権的なデータ収集を伴わずに、複数プラットフォームのユーザー行動から効果的なユーザー関心モデリングを可能にすること。
- 複数のプラットフォームから分散して得られるユーザー埋め込み表現を統合するフレームワークを構築し、ローカルおよび集約レベルの両方でユーザーのプライバシーを保護すること。
- LDPおよびDP技術を用いて、CTR予測性能とプライバシー保護のトレードオフを評価すること。
提案手法
- 各プラットフォームは、自らの行動ログからユーザー埋め込み表現を学習するローカルユーザーモデルを訓練し、データをローカルに保持する。
- ローカルユーザー埋め込み表現は、各プラットフォームの貢献度をモデリングするアテンションベースのアグリゲーターを介して、中央のユーザーサーバーに集約される。
- ローカル埋め込み表現は、アップロードされた埋め込み表現から元のユーザー行動が推測されないよう、局所的微分プライバシー(LDP)によって保護される。
- 集約された埋め込み表現は、さらに微分プライバシー(DP)によって保護され、結合されたユーザー表現のプライバシーが確保される。
- フェデレーテッドトレーニングフレームワークにより、生の行動データではなくモデル勾配が複数のプラットフォーム間で共有され、データ漏洩を防ぎながら協調学習が可能になる。
- 最終的なCTR予測は、集約されたユーザー埋め込み表現と広告特徴量の間でドット積インタラクション層を用いて実行され、他のスコアリング機構よりも優れた性能を示す。
実験結果
リサーチクエスチョン
- RQ1プラットフォーム内行動データが限られている状況でも、複数プラットフォームのユーザー行動データを有効に活用してネイティブ広告CTR予測が可能かどうか。
- RQ2機微な行動ログを含む複数のプラットフォームからユーザー埋め込み表現を集約する際、ユーザーのプライバシーをどのように保護できるか。
- RQ3ローカル埋め込みと集約された埋め込みにLDPおよびDPを適用する際、CTR予測性能とプライバシー保護の最適なトレードオフは何か。
- RQ4アテンション、ドット積など、さまざまなアグリゲーションおよびスコアリング機構(例:アテンション、ドット積)の中で、フェデレーテッドCTR予測設定で最も優れた性能を示すのはどれか。
主な発見
- 提案されたFedCTRフレームワークは、特にプラットフォーム内行動データが不足している状況でも、複数プラットフォームのユーザー行動データを効果的に統合することで、優れたCTR予測性能を達成する。
- ユーザー埋め込み表現と広告特徴量の間でドット積インタラクション層を用いることで、FM、全結合層、外積機構よりも優れたCTR予測性能が得られる。
- アテンションベースのアグリゲーターは、平均プーリング、マックスプーリング、連結処理よりも顕著に性能を向上させ、各プラットフォームのローカル埋め込み表現の情報量をモデリングできる。
- LDPパラメータ(λ_LDP = 0.01)とDPパラメータ(λ_DP = 0.005)を中程度に設定することで、プライバシー保護と予測精度の両立が図られる。
- ローカル埋め込み表現よりも、集約されたユーザー埋め込み表現は逆方向に解釈されにくく、集約によってプラットフォーム固有の行動パターンが曖昧化されるため、プライバシーが強化されている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。