Skip to main content
QUICK REVIEW

[論文レビュー] User Clustering in Online Advertising via Topic Models

Sahin Cem Geyik, Ali Dasdan|arXiv (Cornell University)|Jan 26, 2015
Recommender Systems and Techniques参考文献 16被引用数 3
ひとこと要約

本稿では、ユーザーのイベント履歴に基づいてクラスタリングを行うトピックモデルベースのユーザークラスタリング手法を提案し、類似したイベント履歴を持つユーザーをクラスタにグループ化することで、行動予測の精度を向上させる。pLSAを変更し、ユーザーIDとクラスタIDがイベント履歴を条件とするときに条件付き独立であると仮定することで、再トレーニングを伴わずに新規ユーザーに対する効率的でリアルタイムなクラスタ割り当てが可能となり、A/Bテストにおいてベースライン手法と比較してより低いeCPAおよびeCPCを達成した。

ABSTRACT

In the domain of online advertising, our aim is to serve the best ad to a user who visits a certain webpage, to maximize the chance of a desired action to be performed by this user after seeing the ad. While it is possible to generate a different prediction model for each user to tell if he/she will act on a given ad, the prediction result typically will be quite unreliable with huge variance, since the desired actions are extremely sparse, and the set of users is huge (hundreds of millions) and extremely volatile, i.e., a lot of new users are introduced everyday, or are no longer valid. In this paper we aim to improve the accuracy in finding users who will perform the desired action, by assigning each user to a cluster, where the number of clusters is much smaller than the number of users (in the order of hundreds). Each user will fall into the same cluster with another user if their event history are similar. For this purpose, we modify the probabilistic latent semantic analysis (pLSA) model by assuming the independence of the user and the cluster id, given the history of events. This assumption helps us to identify a cluster of a new user without re-clustering all the users. We present the details of the algorithm we employed as well as the distributed implementation on Hadoop, and some initial results on the clusters that were generated by the algorithm.

研究の動機と目的

  • オンライン広告における希少かつ変動しやすいユーザー行動データの課題に対処し、稀なイベントの予測精度を向上させること。
  • 再トレーニングのオーバーヘッドを最小限に抑えながら、リアルタイム広告入札を支援する効率的でスケーラブルなユーザークラスタリングを実現すること。
  • 新規ユーザーを再計算なしにクラスタに割り当てるクラスタリング手法を開発すること。
  • リアルタイム入札システムにおけるクラスタレベルの行動確率を特徴量として使用することで入札精度を向上させること。
  • 本手法が実世界の広告環境におけるeCPAやeCPCなどの主要なパフォーマンス指標に与える影響を評価すること。

提案手法

  • ユーザーIDとクラスタIDがユーザーのイベント履歴を条件とするときに条件付き独立であると仮定することで、確率的潜在セマンティック分析(pLSA)を変更し、効率的な推論を可能にする。
  • ユーザー行動の主なシグナルとしてビーコンイベント(トラッキングピクセル)を用い、各ビーコンをユーザーの行動的「ドキュメント」内の「単語」として扱う。
  • 期待値最大化(EM)フレームワークを用いてクラスタ割り当てと確率を学習するが、EM計算コストを低減する重要な最適化を実施する。
  • 大規模かつ分散処理可能なデータ処理を実現するため、Hadoopクラスタ上でApache Pigを用いてシステムを実装し、数億人のユーザーをカバーする。
  • クラスタメンバーシップは、新規ユーザーのビーコン履歴を分析することで実行時に行い、全ユーザーのクラスタ割り当てを事前に保存する必要がない。
  • クラスタIDをキャンペーンおよびパブリッシャーの属性と組み合わせて、入札のための行動確率推定に使用する。

実験結果

リサーチクエスチョン

  • RQ1イベント履歴に基づくユーザークラスタリングは、希少かつ変動しやすいユーザー行動データがある中で、オンライン広告における行動予測精度を向上させることができるか?
  • RQ2再トレーニングなしに新規ユーザーをクラスタに割り当てるためのスケーラブルなクラスタリング手法は、どのように設計できるか?
  • RQ3トピックモデルベースのクラスタリングは、従来の類似度ベースの手法と比較して、リアルタイム入札システムにおいてより優れたパフォーマンスを発揮するか?
  • RQ4クラスタベースの行動確率推定は、実世界の広告キャンペーンにおいてeCPAおよびeCPCをどの程度低減できるか?
  • RQ5イベント履歴を条件とするユーザーとクラスタの間の条件付き独立仮定は、モデルの効率性および推論速度をどのように向上させるか?

主な発見

  • 提案手法のトピックモデルベースのクラスタリングは、10日間のA/Bテストにおいて、ベースラインのコサイン類似度手法と比較して顕著に低い効果的1アクションあたりコスト(eCPA)を達成した。
  • eCPCについても低い水準を維持しており、入札の効率性が向上し、実際のユーザー行動とより整合性が高まっていることが示された。
  • テスト期間を通じて一貫した性能向上が確認され、eCPAおよびeCPCの両方の指標で新手法がベースラインを上回った。
  • データのスパarsityによる分散が低減されるため、クラスタレベルの行動確率推定が個別ユーザーの推定よりも正確であることが示唆された。
  • モデル設計のおかげで、再トレーニングを伴わず新規ユーザーに対するリアルタイムなクラスタ割り当てが可能となり、動的な広告環境におけるスケーラブルな展開が可能になった。
  • テスト終盤にeCPAが上昇する傾向が観察されたが、これは行動追跡のアトリビューション遅延に起因するものであり、モデルの失敗とは無関係であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。