[論文レビュー] DeepTrax: Embedding Graphs of Financial Transactions
本稿では、クレジットカード取引を口座と販売業者間の二部グラフとしてモデル化し、時間制約付き取引ペアを用いてスキップグラムモデルでノード埋め込みを学習する、DeepTraxと呼ばれるグラフ埋め込みフレームワークを提案する。この手法は、支出パターン、地理的要因、販売業者カテゴリを捉える意味的意味のある低次元ベクトルを生成し、リンク予測(AUCおよびF1)において優れた性能を示すとともに、特徴として用いることで不正検出性能を5.2%向上させる。
Financial transactions can be considered edges in a heterogeneous graph between entities sending money and entities receiving money. For financial institutions, such a graph is likely large (with millions or billions of edges) while also sparsely connected. It becomes challenging to apply machine learning to such large and sparse graphs. Graph representation learning seeks to embed the nodes of a graph into a Euclidean vector space such that graph topological properties are preserved after the transformation. In this paper, we present a novel application of representation learning to bipartite graphs of credit card transactions in order to learn embeddings of account and merchant entities. Our framework is inspired by popular approaches in graph embeddings and is trained on two internal transaction datasets. This approach yields highly effective embeddings, as quantified by link prediction AUC and F1 score. Further, the resulting entity vectors retain intuitive semantic similarity that is explored through visualizations and other qualitative analyses. Finally, we show how these embeddings can be used as features in downstream machine learning business applications such as fraud detection.
研究の動機と目的
- 1000万ものエンティティを有する大規模かつスパースな金融取引グラフに機械学習を適用する課題に対処すること。
- トポロジーおよび意味的構造を保持する、密な低次元の販売業者および口座エンティティの埋め込みを学習すること。
- これらの埋め込みが不正検出やリンク予測などの下流タスクにおいてどれほど有用であるかを評価すること。
- 地理的およびカテゴリ的パターンが明示的な特徴工学を施さずに、埋め込み空間に自然に出現するかどうかを示すこと。
提案手法
- 本手法は、1つの口座が固定時間窓(例:50秒)内に両方の販売業者と取引を行う場合に、それらの販売業者間にエッジを形成する二部グラフを構築する。
- スケジュールグラムモデルにネガティブサンプリングを適用し、ノード埋め込みを学習する。この際、取引シーケンスをコンテキストウィンドウとして扱う。
- モデルは2つの内部取引データセット上で訓練され、取引行動および近接性を符号化する表現を学習する。
- 埋め込みの評価には、構造的保存性を測定するためのリンク予測AUCおよびF1スコアが用いられる。
- 販売業者埋め込みを不正検出モデルの特徴として使用するトランスファーラーニング設定にフレームワークを拡張する。
- 特徴空間の拡大を抑えるために、埋め込みを1つの不正スコアに圧縮するための補助的なトレーニング可能なMLPが用いられる。
実験結果
リサーチクエスチョン
- RQ1グラフ埋め込み技術は、意味的意味のある構造を有する大規模かつスパースな金融取引ネットワークを効果的に表現できるか?
- RQ2学習された埋め込みが、明示的な特徴を用いずに、販売業者の間の地理的およびカテゴリ的類似性をどの程度捉えられるか?
- RQ3ベースラインモデルと比較して、これらの埋め込みは不正検出などの下流タスクにどの程度一般化できるか?
- RQ4MLPによる埋め込みの圧縮表現(スコア化)は、特徴空間の増加を最小限に抑えつつ予測力を保持できるか?
主な発見
- 本モデルは、高いAUCおよびF1スコアを達成し、埋め込み空間におけるグラフトポロジーの効果的な保存を示している。
- 地理的近接性が埋め込み空間に自然に出現しており、地理的特徴を入力に含めないまま、同じ郵便番号に属する販売業者がクラスタリングしていることが確認された。
- 地域的特徴や文化的なニュアンス(例:ポートランドのブルワリーの地域的集中、ロサンゼルスのコーヒーショプの分布)をモデルが捉えている。
- 生の販売業者埋め込みを直接使用することで、ベースラインモデルと比較して不正検出のAUprが約1.0%向上した。
- トレーニング可能なMLPを用いて埋め込みを1つの不正スコアに圧縮することで、不正検出の有効性が5.2%向上した。これは、効果的なトランスファーラーニングの証明である。
- 異なる文字列表現を持つ重複または関連する販売業者名(例:DUNKIN #341663 Q と Q35)がクラスタリングされるなど、直感的なエンティティ解決が可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。