Skip to main content
QUICK REVIEW

[论文解读] Synthesizing Credit Card Transactions

Erik Altman|arXiv (Cornell University)|Oct 4, 2019
Financial Distress and Bankruptcy Prediction被引用 7
一句话总结

本文提出了一种新颖的、保护隐私的方法,可在无需访问真实交易数据的情况下生成大规模、逼真的合成信用卡交易数据。通过使用随机抽样和基于状态的模拟,对个人的个性化消费行为、地理移动性以及相互关联的金融模式进行建模,该方法生成了超过300亿笔交易,覆盖35年时间——在交易量、分布特征和欺诈特性方面与真实世界数据高度一致,从而为欺诈检测模型的稳健训练提供了支持。

ABSTRACT

Two elements have been essential to AI's recent boom: (1) deep neural nets and the theory and practice behind them; and (2) cloud computing with its abundant labeled data and large computing resources. Abundant labeled data is available for key domains such as images, speech, natural language processing, and recommendation engines. However, there are many other domains where such data is not available, or access to it is highly restricted for privacy reasons, as with health and financial data. Even when abundant data is available, it is often not labeled. Doing such labeling is labor-intensive and non-scalable. As a result, to the best of our knowledge, key domains still lack labeled data or have at most toy data; or the synthetic data must have access to real data from which it can mimic new data. This paper outlines work to generate realistic synthetic data for an important domain: credit card transactions. Some challenges: there are many patterns and correlations in real purchases. There are millions of merchants and innumerable locations. Those merchants offer a wide variety of goods. Who shops where and when? How much do people pay? What is a realistic fraudulent transaction? We use a mixture of technical approaches and domain knowledge including mechanics of credit card processing, a broad set of consumer domains: electronics, clothing, hair styling, etc. Connecting everything is a virtual world. This paper outlines some of our key techniques and provides evidence that the data generated is indeed realistic. Beyond the scope of this paper: (1) use of our data to develop and train models to predict fraud; (2) coupling models and the synthetic dataset to assess performance in designing accelerators such as GPUs and TPUs.

研究动机与目标

  • 解决由于隐私限制和高昂标注成本导致的大规模、带标签金融交易数据严重缺乏的问题。
  • 克服现有合成数据方法的局限性,这些方法需要访问真实数据以进行模仿,或受限于短时间跨度和小规模数据。
  • 构建一个可扩展、符合隐私合规要求的信用卡交易合成数据生成框架,真实反映现实世界中的复杂性,包括正常行为与欺诈行为。
  • 利用虚拟世界和状态机,实现对消费行为在多样化领域(如零售、旅游、医疗)的高保真模拟。
  • 支持稳健的欺诈检测模型开发与训练,并加速硬件设计,类似于生成对抗网络(GANs)和张量处理单元(TPUs)在其他AI领域所起的作用。

提出的方法

  • 基于真实美国人口普查和人口统计数据,为个体消费者建模个性化的支出、收入、信用评分和地理位置的统计分布。
  • 使用从正态分布(及其他分布)中进行随机抽样的方法,分配个体层面的参数,同时保持总体的均值和标准差。
  • 应用奇异值分解(SVD)和特定设计的技术,以确保在数据中未直接提供的金融指标之间(如旅游与收入)实现准确的交叉相关性。
  • 通过状态机模拟虚拟世界,以建模动态行为(如旅行、居住地变化和工作时间表),从而实现交易的时间和上下文合理性。
  • 记录虚拟世界中的交互行为,生成包含卡类型(信用卡、借记卡、预付卡)、渠道(面对面、线上)和交易金额的交易日志。
  • 利用真实世界汇总统计数据(如欺诈率、按类别划分的支出、MCC代码)校准输入参数,确保生成的数据与经验分布一致。

实验结果

研究问题

  • RQ1是否可以在不访问真实交易数据的前提下,生成逼真的合成信用卡交易数据,同时保留复杂的关联关系和时间动态?
  • RQ2与基于总体水平波动的模型相比,采用具有稳定个人分布的个性化消费行为,能在多大程度上提升合成交易的真实性?
  • RQ3当直接数据不可用时,如何准确建模不同金融指标(如旅行频率与消费水平)之间的交叉相关性?
  • RQ4通过状态机和行为规则构建的虚拟世界模拟,能否生成在时间、地理和交易类型方面与真实世界汇总统计数据相匹配的交易数据?
  • RQ5为有效支持欺诈检测模型的训练与评估以及硬件加速,所需的合成数据在规模和保真度方面应达到何种水平?

主要发现

  • 该方法成功在35年期间内,为20,000名虚拟消费者生成了超过3亿笔合成交易,数据大小在CSV格式下超过20 GB。
  • 生成的数据在关键指标上与真实世界统计数据高度一致:信用卡/借记卡/预付卡使用比例、年交易笔数、单笔交易支出分布以及欺诈率(包括线上欺诈发生率更高)。
  • 合成数据准确反映了变量间的现实交叉相关性,如收入与境外旅行的关系,并准确呈现了按类别(如餐饮、电子产品)和MCC代码划分的消费情况。
  • 系统能够生成逼真的交易片段和多粒度汇总统计(包括终身、年度、单笔交易),其数值与真实世界基准高度一致。
  • 该合成数据集的规模超过广泛使用的Kaggle欺诈数据集的1,000倍以上,时间跨度长达数十年而非数天,支持长期行为建模并提升模型泛化能力。
  • 该方法可生成异构且统一的数据集,整合信用卡交易、贷款申请、医疗支出和客服中心交互信息,推动多模态人工智能研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。