Skip to main content
QUICK REVIEW

[论文解读] Using generative adversarial networks to synthesize artificial financial datasets

Dmitry Efimov, Di Xu|arXiv (Cornell University)|Feb 6, 2020
Stock Market Forecasting Methods被引用 11
一句话总结

本文提出了一种基于新型条件 DRAGAN 的 GAN 架构,用于生成高保真度的人工金融数据集,其分布与现实世界中的信贷和欺诈风险数据高度一致。该 GAN 在三个 American Express 数据集上进行训练,生成的数据在特征分布、多变量结构以及模型性能方面均与真实数据匹配,使用合成数据训练的监督模型 AUC 分数与使用真实数据训练的模型相差仅 3-5%。

ABSTRACT

Generative Adversarial Networks (GANs) became very popular for generation of realistically looking images. In this paper, we propose to use GANs to synthesize artificial financial data for research and benchmarking purposes. We test this approach on three American Express datasets, and show that properly trained GANs can replicate these datasets with high fidelity. For our experiments, we define a novel type of GAN, and suggest methods for data preprocessing that allow good training and testing performance of GANs. We also discuss methods for evaluating the quality of generated data, and their comparison with the original real data.

研究动机与目标

  • 为解决在信贷和欺诈风险管理领域缺乏公开可用、高质量的金融数据集以供机器学习模型基准测试的问题。
  • 开发一种生成合成金融数据的方法,以保留真实金融数据的统计特性及复杂关系。
  • 评估基于 GAN 生成的数据训练的机器学习模型是否能达到与基于真实数据训练的模型相当的性能。
  • 通过生成不源自真实客户的人工数据来确保数据隐私,从而实现公开共享。

提出的方法

  • 提出了一种结合条件 GAN 与 DRAGAN 的新型 GAN 架构,以提升训练稳定性和生成质量。
  • 应用数据预处理技术,包括归一化、独热编码,以及对偏态和分类特征的处理,以提升 GAN 的训练与测试性能。
  • 使用 DataQC 工具包对真实数据与生成数据在单变量和多变量分布上的相似性进行定量评估。
  • 应用 t-SNE 可视化方法,比较真实数据与生成数据在低维空间中的整体结构与聚类情况。
  • 使用相同的超参数,在真实数据和 GAN 生成的数据上分别训练相同的监督机器学习模型,以实现直接的性能对比。
  • 通过在样本外真实数据上的 AUC 指标衡量模型性能,以评估合成数据的泛化能力与保真度。

实验结果

研究问题

  • RQ1GAN 架构能否有效学习并再现真实金融数据集中复杂的统计分布与关系?
  • RQ2在 GAN 生成的金融数据上训练的机器学习模型,其性能在多大程度上可与在真实数据上训练的模型相匹配?
  • RQ3如何优化数据预处理以提升在高维、异构金融数据上的 GAN 训练与生成质量?
  • RQ4哪些定量与定性指标能够可靠地评估合成金融数据与真实数据之间的保真度?

主要发现

  • 所提出的基于条件 DRAGAN 的 GAN 成功以高保真度再现了三个真实 American Express 数据集的单变量与多变量分布。
  • 生成数据的特征直方图与真实数据高度匹配,包括偏态、二值与多峰分布,仅在连续特征上观察到轻微平滑。
  • t-SNE 可视化显示,生成数据保留了真实数据的整体结构、聚类模式与密度分布。
  • 在合成数据上训练的监督模型 AUC 分数与在真实数据上训练的模型相差仅 3-5 个百分点,具体为:数据集 A:0.66 vs. 0.63,数据集 B:0.80 vs. 0.78,数据集 C:0.89 vs. 0.86。
  • 在真实数据与合成数据上训练的模型之间性能差距较小,表明合成数据可作为金融机器学习研究的可靠基准。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。