Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive Factorization Network: Learning Adaptive-Order Feature Interactions

Weiyu Cheng, Yanyan Shen|arXiv (Cornell University)|Sep 7, 2019
Recommender Systems and Techniques参考文献 22被引用数 10
ひとこと要約

本稿では、特徴量のべき乗をトレーナブルな係数としてパrameter化する対数変換層を用いて、データから任意の次数の特徴量相互作用を適応的に学習する、新しい深層学習モデルである適応的要因分解ネットワーク(AFN)を提案する。従来の因子分解モデルが最大相互作用次数を固定し、すべての組み合わせを列挙するのに対し、AFNは動的に有用なクロス特徴量を発見・重み付けする。4つの実世界データセットにおいて最先端の性能を達成し、表現力と効率性の両方を向上させた。

ABSTRACT

Various factorization-based methods have been proposed to leverage second-order, or higher-order cross features for boosting the performance of predictive models. They generally enumerate all the cross features under a predefined maximum order, and then identify useful feature interactions through model training, which suffer from two drawbacks. First, they have to make a trade-off between the expressiveness of higher-order cross features and the computational cost, resulting in suboptimal predictions. Second, enumerating all the cross features, including irrelevant ones, may introduce noisy feature combinations that degrade model performance. In this work, we propose the Adaptive Factorization Network (AFN), a new model that learns arbitrary-order cross features adaptively from data. The core of AFN is a logarithmic transformation layer to convert the power of each feature in a feature combination into the coefficient to be learned. The experimental results on four real datasets demonstrate the superior predictive performance of AFN against the start-of-the-arts.

研究の動機と目的

  • 最大相互作用次数を固定する従来の因子分解モデルが直面する計算コストとノイズの多い特徴量組み合わせの問題を解消すること。
  • すべての可能な組み合わせを列挙せずに、判別性の高い高次特徴量相互作用の自動発見を可能にすること。
  • データから特徴量相互作用次数と重みを同時に学習できる微分可能でエンドツーエンドのフレームワークを開発すること。
  • 既存の因子分解ベースのモデルと比較して、予測性能を向上させつつ計算効率を維持すること。

提案手法

  • 特徴量のべき乗をトレーナブルな係数としてパラメータ化するための対数ニューラル変換層を導入し、任意の次数の特徴量相互作用モデリングを可能にする。
  • ベクトル単位の対数ニューロンを用いて、クロス特徴量の組み合わせにおける各特徴量の次数(指数)を自動で学習する。
  • 変換された適応的次数の特徴量同士の要素ごとの相互作用をモデル化するためのフィードフォワードニューラルネットワークを適用し、最終予測を生成する。
  • 対数変換を微分可能演算として扱い、バックプロパゲーションにより特徴量の次数と相互作用重みを同時に最適化可能にする。
  • 特徴量の次数が0または1に制限される場合、因子分解マシン(FMs)および高次FMs(HOFMs)が特別なケースとして一般化されることを示す。
  • 対数ニューロン間でパラメータ共有を採用することで、モデルの複雑さを低減し、過学習を防止する。

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルは、最大相互作用次数を事前に定義せずに、任意の次数の特徴量相互作用を学習できるか?
  • RQ2特徴量相互作用次数を適応的に学習することで、固定次数モデルに比べてより優れた予測性能が得られるか?
  • RQ3エンドツーエンド学習によって、不要またはノイズの多い特徴量の組み合わせを効果的に抑制できるか?
  • RQ4訓練過程において学習された特徴量の次数はどのように変化するか?また、異なるデータセットにおける次数の分布はどのようになるか?
  • RQ5実世界の応用において、AFNは既存の因子分解ベースのモデルを一般化または上回る性能を示せるか?

主な発見

  • AFNは、CriteoやFrappeを含む4つの実世界データセットで最先端の性能を達成し、FMs、HOFMs、AFMを上回った。
  • AFNで学習された特徴量の次数は-1から1の広い範囲に分布しており、クロス特徴量の次数は4から10にまで達しており、動的でデータ駆動の相互作用発見を示している。
  • わずか3つの対数ニューロンでも強力な性能を維持しており、重要なクロス特徴量を少数で特定できる能力を示している。
  • 隠れ層の深さが変化してもモデルの性能が安定しており、深さが0であっても劣化が最小限に抑えられており、対数変換層の有効性が裏付けられた。
  • 隠れ層パラメータが600を超えると過学習が発生し、モデル容量と一般化性能の明確なトレードオフが示された。
  • 事例研究により、AFNが意味のあるクロス特徴量(例:(item_id, is_free, country) や (user_id, item_id))を効果的に学習していることが確認され、推薦システムにおける既知の信号重要性と整合的であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。