Skip to main content
QUICK REVIEW

[論文レビュー] Fusing Multifaceted Transaction Data for User Modeling and Demographic Prediction

Yehezkel S. Resheff, Moni Shahar|arXiv (Cornell University)|Dec 19, 2017
Authorship Attribution and Profiling参考文献 8被引用数 4
ひとこと要約

本論文は、店舗タイプや取引カテゴリなどの複数のカテゴリカル取引データの系列と、補助的な関係データを統合するエンドツーエンドのディープラーニング手法を提案する。この手法により、マルチタスクなデモグラフィック予測のための強固なユーザーレプリゼンテーションを学習する。学習済み埋め込みと早期停止を用いることで、性別、婚姻状態、教育水準の予測において、ベースラインを数百分の1ポイント以上上回る最先端の性能を達成する。

ABSTRACT

Inferring user characteristics such as demographic attributes is of the utmost importance in many user-centric applications. Demographic data is an enabler of personalization, identity security, and other applications. Despite that, this data is sensitive and often hard to obtain. Previous work has shown that purchase history can be used for multi-task prediction of many demographic fields such as gender and marital status. Here we present an embedding based method to integrate multifaceted sequences of transaction data, together with auxiliary relational tables, for better user modeling and demographic prediction.

研究の動機と目的

  • プライバシー制約や不完全なユーザーデータのため、性別、婚姻状態、教育水準といった機微なデモグラフィック属性を取引データから推定する課題に対処すること。
  • 取引系列をデモグラフィック情報の代理として活用することで、金融アプリケーションにおけるユーザーモデリングを改善すること。
  • 異種の取引系列と構造化された関係データを統合する、統一的でエンドツーエンドのフレームワークを構築し、マルチタスクなデモグラフィック予測を実現すること。
  • 直接的なパーソナライゼーションを超えて、学習済みユーザーレプリゼンテーションがライフイベントの検出やアカウント改ざんの検知にどのように有用であるかを検討すること。

提案手法

  • カテゴリカルな取引要素(例:マーチャントID)を埋め込み関数で密度ベクトル表現にマップし、系列レベルの表現は要素埋め込みの平均化によって形成される。
  • 各取引系列は、学習済み埋め込みの平均プーリングにより固定サイズのベクトルに変換され、後続のモデリングに一貫した入力サイズを提供する。
  • ユーザーレプリゼンテーションは、埋め込み済み系列と補助的な関係特徴(例:口座種別、収入)を連結し、全結合のフィードフォワードネットワークを通過させることで形成される。
  • 共有ユーザーレプリゼンテーションを用いて複数のデモグラフィック属性(例:性別、教育水準)を同時に予測するマルチタスク学習を採用する。
  • 埋め込みの後に1〜2層の全結合層があれば十分であり、これは主に系列埋め込み機構が表現力の大部分を担っていることを示している。
  • モデルはエンドツーエンドで500エポックにわたり訓練され、早期停止が適用され、2つのバリエーションが評価された:マルチタスク学習と各ターゲットごとのファインチューニング。

実験結果

リサーチクエスチョン

  • RQ1複数のカテゴリカル取引データの系列を関係データと効果的に統合することで、デモグラフィック予測の精度が向上するか?
  • RQ2共有表現を用いたマルチタスク学習は、各ターゲットごとのファインチューニングと比較して、過学習を低減し一般化性能を向上させるか?
  • RQ3埋め込みサイズやネットワークの深さといった設計選択が、デモグラフィック予測におけるモデル性能にどのように影響するか?
  • RQ4学習済みユーザーレプリゼンテーションは、直接的なデモグラフィック推定を超えて、ライフイベントやアカウント改ざんの検出にどの程度有用か?
  • RQ5この手法は、ユーザーモデリングのための生の取引データの使用に代わるプライバシー保護型の代替手段として機能するか?

主な発見

  • 提案手法は、性別や婚姻状態の予測では数百分の1ポイント以上、教育水準の予測では1%未満の改善を示し、3つのベースライン(arg-max、スタッキング、PCA)をすべてのデモグラフィック予測タスクで上回った。
  • マルチタスクモデルは、各ターゲットごとのファインチューニングよりも高い性能を達成しており、共同最適化が過学習を低減する正則化効果を提供していることが示唆された。
  • 埋め込みサイズを10から50に増加させると、性能向上が最大となり、さらに100に増やすとわずかな改善にとどまった。
  • 埋め込みの後に1〜2層の全結合層があれば十分であり、これは系列埋め込み機構がほとんどすべての必要な表現能力を担っていることを示している。
  • ファインチューニングなしでも高い精度を維持でき、多様なデモグラフィック属性にわたり結果が安定している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。