Skip to main content
QUICK REVIEW

[論文レビュー] Targeted Advertising Based on Browsing History

Yong Zhang, Hongming Zhou|arXiv (Cornell University)|Nov 13, 2017
Advanced Text Analysis Techniques参考文献 32被引用数 4
ひとこと要約

本稿では、ユーザーのブラウジング履歴—具体的にはハッシュ化されたユーザーIDと訪問したドメインURL—のみを用いて、オンラインユーザーのデモグラフィック属性(性別や年齢など)を予測する機械学習フレームワークを提案する。単語埋め込みとTF-IDF重み付けを組み合わせて、密な非教師ありウェブサイト特徴ベクトルを生成し、これをユーザー単位の表現に集約した後、サポートベクターマシン分類器を適用することで、従来手法(特にカテゴリベースラベル付けやLSI)と比較して顕著に高い予測精度を達成した。

ABSTRACT

Audience interest, demography, purchase behavior and other possible classifications are ex- tremely important factors to be carefully studied in a targeting campaign. This information can help advertisers and publishers deliver advertisements to the right audience group. How- ever, it is not easy to collect such information, especially for the online audience with whom we have limited interaction and minimum deterministic knowledge. In this paper, we pro- pose a predictive framework that can estimate online audience demographic attributes based on their browsing histories. Under the proposed framework, first, we retrieve the content of the websites visited by audience, and represent the content as website feature vectors; second, we aggregate the vectors of websites that audience have visited and arrive at feature vectors representing the users; finally, the support vector machine is exploited to predict the audience demographic attributes. The key to achieving good prediction performance is preparing representative features of the audience. Word Embedding, a widely used tech- nique in natural language processing tasks, together with term frequency-inverse document frequency weighting scheme is used in the proposed method. This new representation ap- proach is unsupervised and very easy to implement. The experimental results demonstrate that the new audience feature representation method is more powerful than existing baseline methods, leading to a great improvement in prediction accuracy.

研究の動機と目的

  • 直接的な個人情報が入手不可、またはプライバシー法規制により制限される状況下で、ターゲティング広告におけるユーザーのデモグラフィック属性を予測する課題に対処すること。
  • ハッシュ化されたユーザーIDとドメインレベルのURLに限定して、PIIを必要としない、スケーラブルでプライバシー準拠の手法を開発すること。
  • ウェブサイトのコンテンツからより代表的で情報豊富なユーザー特徴ベクトルを構築することで、デモグラフィック予測の精度を向上させること。
  • ウェブサイトおよびユーザーの特徴表現技術の異なるバリエーションを評価・比較し、デモグラフィック分類に最も効果的な組み合わせを同定すること。

提案手法

  • Webクローラーを用いて、ユーザーが訪問したウェブサイトのテキストコンテンツを収集し、PIIを回避することでプライバシー基準を遵守する。
  • 単語埋め込み(例:Word2Vec)と部分線形スケーリングされたTF-IDF重み付け方式を組み合わせることで、ウェブサイトのコンテンツを密な特徴ベクトルに変換する。
  • ウェブサイト特徴ベクトルを対数平均集約法を用いて集約することで、ユーザー単位の特徴ベクトルを構築し、集団的なブラウジングプロファイルを効果的に捉える。
  • 集約されたユーザー特徴ベクトルを用いて、サポートベクターマシン(SVM)分類器を訓練し、性別や年齢などのデモグラフィック属性を予測する。
  • 実世界のデータセット(Demo100およびDemo20)を用いてフレームワークを評価し、クローリングルールおよび特徴表現のバリエーションに関するアブレーションスタディを実施する。
  • 同一の実験条件下で、カテゴリベース、LSI、RNN、標準TF-IDFアプローチなどの複数のベースラインと比較する。

実験結果

リサーチクエスチョン

  • RQ1ソーシャルメディアやパネルデータに依存せずに、ブラウジング履歴から得られるウェブサイトコンテンツを有効に活用してユーザーのデモグラフィック属性を予測できるか?
  • RQ2TF-IDF重み付けと組み合わせた単語埋め込みの統合は、従来の手法と比較してウェブサイトコンテンツの表現をどのように改善するか?
  • RQ3相関するブラウジング行動をモデル化する必要がある場合、集約・分類フレームワークは、回帰・集約フレームワークを上回る性能を示すか?
  • RQ4プライバシーを保ちつつデモグラフィック予測精度を最大化するための最適なWebクローリング戦略は何か?
  • RQ5ウェブサイトコンテンツの性質を考慮すると、RNNのようなディープラーニングモデルの性能は、より単純で効率の良いモデルに比べて劣るのか?

主な発見

  • 単語埋め込みにTF-IDF重み付けを組み合わせた本手法は、Demo100データセットにおいて年齢予測で83.95%、性別予測で74.42%の精度を達成し、すべてのベースライン手法を顕著に上回った。
  • ウェブサイトベクトルの対数平均集約法が、単純な平均化や合計よりも優れており、ユーザーのプロファイルをより適切に表現する能力を向上させた。
  • 集約・分類フレームワークは、回帰・集約フレームワークを上回る精度を示し、ウェブサイト訪問が独立であるという仮定が誤っており、相関するブラウジング行動を明示的にモデル化すべきであることを示した。
  • RNNベースのモデルは、長期間のシーケンスや断片的なコンテンツの処理に課題を抱えるため、単純なモデルに比べて性能が劣り、この文脈におけるディープラーニングの限界を浮き彫りにした。
  • TF-IDF_word2vec表現手法は、標準TF-IDFと比較して特徴のスパarsityと次元数を低減し、より良い一般化性能と高い分類精度をもたらした。
  • 本手法は計算的に効率的で、教師なしであるため、人為的ラベル付けデータを一切不要としており、プライバシー準拠の広告システムにおける実世界へのスケーラブルかつ実用的な展開が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。