[論文レビュー] Using Neural Networks for Click Prediction of Sponsored Search
この論文は、スポンサードサーチにおけるクリック予測のための2段階型システムを提案しており、前向きニューラルネットワーク(ANN)と勾配ブースティング木(MatrixNet)を組み合わせることで、クリックスルーレート(CTR)推定を向上させている。IDベースの特徴量を高次元でスパースに表現するANNを用い、その出力をMatrixNetに供給することで、ベースラインのMatrixNetシステムに比べて、対数尤度で0.22%、auPRCで0.48%の向上を達成した。これは大規模データを用いた場合に顕著な性能向上を示している。
Sponsored search is a multi-billion dollar industry and makes up a major source of revenue for search engines (SE). click-through-rate (CTR) estimation plays a crucial role for ads selection, and greatly affects the SE revenue, advertiser traffic and user experience. We propose a novel architecture for solving CTR prediction problem by combining artificial neural networks (ANN) with decision trees. First we compare ANN with respect to other popular machine learning models being used for this task. Then we go on to combine ANN with MatrixNet (proprietary implementation of boosted trees) and evaluate the performance of the system as a whole. The results show that our approach provides significant improvement over existing models.
研究の動機と目的
- 検索エンジンの収益と広告の関連性にとって重要な要素である、スポンサードサーチにおけるクリックスルーレート(CTR)予測の改善。
- 広告クリック予測に一般的に見られるスパースかつ高次元のIDベース特徴量をモデル化するための人工ニューラルネットワーク(ANN)の有効性の評価。
- Yandexが既に運用しているMatrixNetベースのCTR予測パイプラインにANNを統合し、性能向上を評価すること。
- トレーニングデータ量とアンサンブル手法が、この文脈におけるANNの性能に与える影響の調査。
提案手法
- システムは2段階のアーキテクチャを採用している:まず、1-of-kエンコーディングと特徴量の出現頻度による閾値処理およびハッシュ化を用いた次元削減により、元のスパースなIDベースの特徴量(例:ユーザー、広告、クエリ、キーワードID)を処理するANNが動作する。
- ANNの埋め込み層は、高次元スパース特徴量の密表現を学習し、その後にReLU活性化関数を用いた前向きネットワークに渡される。
- ANNの出力は、Yandexで既に本番稼働している勾配ブースティング木モデルであるMatrixNetの追加入力特徴量として使用される。
- 複数の異なる初期化で学習された6つのANNをアンサンブル化することで、予測の安定性と性能を向上させる。
- モデルは交差エントロピー損失にL2正則化を適用し、確率的勾配降下法で最適化される。
- 性能評価には対数尤度(NLL)と精度-再現曲線下の面積(auPRC)が用いられ、データは70%トレーニング、20%バリデーション、10%テストに分割される。
実験結果
リサーチクエスチョン
- RQ1前向きニューラルネットワークは、スポンサードサーチのクリック予測において、スパースかつ高次元のIDベース特徴量を効果的にモデル化できるか?
- RQ2CTR予測において、ANNの性能はロジスティック回帰のような従来の線形モデルと比べてどうか?
- RQ3ANNと勾配ブースティング木(MatrixNet)を組み合わせることで、既存のMatrixNet単体のシステムに比べて測定可能な向上が得られるか?
- RQ4トレーニングデータ量が増加するにつれて、ANNとロジスティック回帰の性能差はどのように変化するか?
- RQ5アンサンブル手法は、この低レベルで変動が大きい特徴空間におけるANNの予測力をさらに強化できるか?
主な発見
- 6つのANNのアンサンブルは、単一のANNに比べて対数尤度で0.24%、auPRCで1.15%の向上を達成し、アンサンブル学習の利点を示した。
- ANNの出力をMatrixNetの追加入力特徴量として使用することで、元の特徴量のみを用いたベースラインのMatrixNetに比べて、対数尤度で0.22%、auPRCで0.48%の向上が得られた。
- トレーニングデータ量が増加するにつれて、ANNはロジスティック回帰を上回るようになり、性能差は着実に拡大する傾向にあり、ANNが大規模データをより効果的に活用できることを示している。
- トレーニングデータが少ない場合、ロジスティック回帰は単一のANNを上回るが、データ量が増加するにつれてANNが性能で上回るようになる。
- 結果として、ANN + MatrixNetの完全なシステムは、既存の本番モデルに対して統計的に有意な向上を示しており、実務的に意味のある0.22%の対数尤度の向上が得られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。