Skip to main content
QUICK REVIEW

[論文レビュー] Synthesizing Credit Card Transactions

Erik Altman|arXiv (Cornell University)|Oct 4, 2019
Financial Distress and Bankruptcy Prediction被引用数 7
ひとこと要約

本稿では、実際の取引データにアクセスせずに、大規模かつ現実的な合成クレジットカード取引データを生成する、プライバシーを守る新規手法を提示する。個人の個別化された支出行動、地理的移動性、相関関係のある金融パターンを、確率的サンプリングと状態ベースのシミュレーションを用いてモデル化することで、35年間にわたり3億件を超える合成取引を生成。取引の量、分布、不正取引の特性において現実世界の統計と一致し、不正検知モデルの強固な訓練を可能にする。

ABSTRACT

Two elements have been essential to AI's recent boom: (1) deep neural nets and the theory and practice behind them; and (2) cloud computing with its abundant labeled data and large computing resources. Abundant labeled data is available for key domains such as images, speech, natural language processing, and recommendation engines. However, there are many other domains where such data is not available, or access to it is highly restricted for privacy reasons, as with health and financial data. Even when abundant data is available, it is often not labeled. Doing such labeling is labor-intensive and non-scalable. As a result, to the best of our knowledge, key domains still lack labeled data or have at most toy data; or the synthetic data must have access to real data from which it can mimic new data. This paper outlines work to generate realistic synthetic data for an important domain: credit card transactions. Some challenges: there are many patterns and correlations in real purchases. There are millions of merchants and innumerable locations. Those merchants offer a wide variety of goods. Who shops where and when? How much do people pay? What is a realistic fraudulent transaction? We use a mixture of technical approaches and domain knowledge including mechanics of credit card processing, a broad set of consumer domains: electronics, clothing, hair styling, etc. Connecting everything is a virtual world. This paper outlines some of our key techniques and provides evidence that the data generated is indeed realistic. Beyond the scope of this paper: (1) use of our data to develop and train models to predict fraud; (2) coupling models and the synthetic dataset to assess performance in designing accelerators such as GPUs and TPUs.

研究の動機と目的

  • プライバシー制限と高いラベル付けコストのため、大規模かつラベル付きの金融取引データの不足という深刻な課題に対処する。
  • 模倣に実際のデータが必要な既存の合成データ手法や、短期間・小規模に制限される手法の限界を克服する。
  • 現実世界の複雑さ(通常および不正行為を含む)を反映する、スケーラブルでプライバシー準拠のクレジットカード取引用合成データ生成フレームワークを構築する。
  • バーチャルワールドとステートマシンを用いて、多様な分野(例:小売、旅行、医療)における消費者行動の高精度なシミュレーションを可能にする。
  • 不正検知モデルの開発・訓練を支援し、ハードウェア設計の加速を図る。これは、GAN や TPU が他の AI 領域を発展させたのと同様の役割を果たす。

提案手法

  • 米国国勢調査および人口統計データから得た実際のデータを基に、支出、収入、信用スコア、地理的場所に関する個別統計分布を個人ごとにモデル化する。
  • 正規分布(およびその他の分布)からの確率的サンプリングを用い、個別レベルのパラメータを割り当てるが、同時に集団レベルの平均と標準偏差を保持する。
  • 直接データに存在しない金融指標間の正確な相関関係(例:旅行と収入の相関)を確保するため、特異値分解(SVD)と特段の技術を適用する。
  • 状態マシンを用いたバーチャルワールドをシミュレートし、移動、自宅位置、勤務スケジュールなどの動的行動をモデル化することで、取引の現実的なタイミングと文脈を実現する。
  • バーチャルワールド内の相互作用を記録し、カード種別(クレジット、デビット、プリペイド)、チャnel(対面、オンライン)、取引金額を含む取引ログを生成する。
  • 実世界の要約統計(例:不正率、カテゴリ別支出、MCCコード)を用いて入力パラメータをキャリブレーションし、生成されたデータが実証的分布と一致することを保証する。

実験結果

リサーチクエスチョン

  • RQ1実際の取引データにアクセスせずに、複雑な相関関係と時間的ダイナミクスを保持した現実的な合成クレジットカード取引データを生成できるか?
  • RQ2集団レベルの変動ではなく、安定した個人固有の分布を持つ個別化された支出行動が、合成取引の現実性をどの程度向上できるか?
  • RQ3直接データが入手できない場合に、旅行頻度や支出といった多様な金融指標間の相関関係をどのように正確にモデル化できるか?
  • RQ4ステートマシンと行動ルールを備えたバーチャルワールドシミュレーションにより、時間、地理、取引タイプにわたる実世界の要約統計と一致する取引データを生成できるか?
  • RQ5不正検知モデルの訓練および評価、ハードウェア加速を意味的に支援するには、どのスケールと忠実度の合成データが必要か?

主な発見

  • 本手法により、35年間にわたり2万人のバーチャル消費者を対象に、3億件を超える合成取引が生成され、CSV形式で20GBを超えるデータサイズとなった。
  • 生成されたデータは、クレジット/デビット/プリペイドカード使用比、年間取引件数、1件あたりの支出分布、不正率(オンライン不正の割合が高め)といった主要指標で実世界の統計と一致している。
  • 収入と海外旅行の間の現実的な相関関係が反映されており、レストランや家電などカテゴリ別支出、MCCコードの正確な表現も含まれている。
  • ライフタイム、年間、1件あたりの複数の粒度で、現実世界のベンチマークと密接に一致するリアルな取引スニペットおよび要約統計を生成している。
  • 本合成データセットは、広く使われているKaggleの不正データセットの1,000倍以上も大きく、数日ではなく数十年にわたる期間をカバーしており、長期的な行動モデル化とモデルの汎化性能の向上を可能にする。
  • 本手法により、クレジットカード取引に加え、ローン申請、医療費、コールセンターのやり取りを統合した多様で一元化されたデータセットの生成が可能となり、マルチモーダルAI研究を促進する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。