Skip to main content
QUICK REVIEW

[論文レビュー] Product-based Neural Networks for User Response Prediction over Multi-field Categorical Data

Yanru Qu, Bohui Fang|arXiv (Cornell University)|Jul 1, 2018
Recommender Systems and TechniquesComputer Science参考文献 47被引用数 22
ひとこと要約

本稿では、多フィールド分類データにおけるユーザー反応予測を向上させるために、製品ベースニューラルネットワーク(PNNs)と新しいPIN(Product-network In Network)アーキテクチャを提案する。フィールドに依存する特徴相互作用をモデル化するためのカーネル積層を導入し、深層ネットワークにおける勾配感度の欠如問題に対処することで、PNNsは4つの産業的データセットにおいてAUCおよびログ損失の両面で8つのベースラインを上回る最先端の性能を達成し、オンラインA/BテストではCTRに34.67%の相対的向上を示した。

ABSTRACT

User response prediction is a crucial component for personalized information retrieval and filtering scenarios, such as recommender system and web search. The data in user response prediction is mostly in a multi-field categorical format and transformed into sparse representations via one-hot encoding. Due to the sparsity problems in representation and optimization, most research focuses on feature engineering and shallow modeling. Recently, deep neural networks have attracted research attention on such a problem for their high capacity and end-to-end training scheme. In this paper, we study user response prediction in the scenario of click prediction. We first analyze a coupled gradient issue in latent vector-based models and propose kernel product to learn field-aware feature interactions. Then we discuss an insensitive gradient issue in DNN-based models and propose Product-based Neural Network (PNN) which adopts a feature extractor to explore feature interactions. Generalizing the kernel product to a net-in-net architecture, we further propose Product-network In Network (PIN) which can generalize previous models. Extensive experiments on 4 industrial datasets and 1 contest dataset demonstrate that our models consistently outperform 8 baselines on both AUC and log loss. Besides, PIN makes great CTR improvement (relatively 34.67%) in online A/B test.

研究の動機と目的

  • 潜在ベクトルベースのモデル(例:FFM)で見られる結合された勾配問題に対処すること。これは、効果的なフィールドに依存する特徴相互作用の学習を制限する。
  • スパースでワンホットエンコードされた多フィールド分類データ上で訓練する際、標準DNNが示す勾配感度の欠如問題を克服すること。
  • 高次特徴相互作用を明示的にモデル化しつつ、効率性とスケーラビリティを維持する深層学習アーキテクチャを設計すること。
  • FM、FFM、標準DNNといった既存モデルを統合・改善する一般化可能なフレームワークを構築すること。
  • 実世界の産業的データセット上で提案モデルを検証し、オフライン指標およびオンラインA/Bテストの両方で優れた性能を示すこと。

提案手法

  • フィールド固有の埋め込み間のペアワイズ相互作用に可学習カーネルを適用することで、フィールドに依存する特徴相互作用を計算するカーネル積層を提案する。
  • 特徴抽出器と積層を組み合わせた製品ベースニューラルネットワーク(PNN)アーキテクチャを導入し、深層分類器に渡す前に特徴相互作用をモデル化する。
  • PNNの一般化として、積層をサブネットワークに置き換えることでより柔軟な相互作用モデリングを可能にする「Product-network In Network(PIN)」を構築する。
  • 理論的分析を通じて、標準DNNが多項式関数(poly-2)を学習する際、勾配感度の欠如を示すことを示す。これはユーザー反応予測において一般的な関数形である。
  • 多項式関数(poly-2)を用いた合成実験により、ユニバーサル近似性があるにもかかわらず、DNNが最適解に収束しないことを検証し、明示的な相互作用モデリングの必要性を強調する。
  • オフラインおよび実世界のデータセットの両方でAUCとログ損失を評価指標として用い、確率的勾配降下法を用いてエンドツーエンドでモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1従来の潜在ベクトルモデル(例:FFM)と比較して、フィールドに依存する特徴相互作用を、結合された勾配問題に苦しむことなくより効果的に学習できるか?
  • RQ2標準DNNと比較して、スパースで多フィールド分類データ上で明示的な積層を含めることで性能が向上するか?
  • RQ3FM、FFM、標準DNNといった既存モデルを統合・上回る一般アーキテクチャ(例:PIN)が、ユーザー反応予測において有効であるか?
  • RQ4DNNにおける勾配感度の欠如が、スパースデータ環境下での単純で構造的な関数(例:poly-2)の学習をどの程度妨げるか?
  • RQ5提案モデルは、実世界の産業的応用において、オフライン指標とオンラインA/Bテストの両方で測定可能な改善を達成するか?

主な発見

  • PNNsは4つの産業的データセットにおいて、AUCおよびログ損失の両面で8つのベースラインを一貫して上回り、優れた一般化能力と予測精度を示した。
  • PINアーキテクチャはオンラインA/BテストでCTRに34.67%の相対的向上を達成し、実世界での有効性を裏付けた。
  • 合成実験では、標準DNNが多項式関数(poly-2)に対して最適解に収束しないことが判明した。これは、深さや幅を増やしても同様に成り立つため、根本的な勾配感度の欠如が原因である。
  • カーネル積層は、FFMや類似モデルに見られる結合された勾配問題を効果的に緩和し、フィールドに依存する特徴相互作用を的確に捉えている。
  • 本稿で提案されたモデルは、多様なデータスパarsityレベルにおいても安定した性能を示し、標準DNNと比較して訓練の安定性と収束性が向上した。
  • PINの一般化能力は、既存モデルを統合・改善できる能力を通じて実証され、今後の情報検索システムにおける深層学習の有望な方向性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。