Skip to main content
QUICK REVIEW

[论文解读] Synthesizing Property & Casualty Ratemaking Datasets using Generative Adversarial Networks.

Marie‐Pier Côté, Brian Hartman|arXiv (Cornell University)|Aug 13, 2020
Privacy-Preserving Technologies in Data参考文献 14被引用 10
一句话总结

本文提出了三种生成对抗网络(GAN)架构——MC-WGAN-GP、CTGAN 和 MNCDP-GAN——用于生成保密的财产与意外伤害保险费率制定数据集,同时保持数据结构和多变量关系。MC-WGAN-GP 在保真度方面表现最佳,能精确复制单变量和多变量分布;CTGAN 最易于实现;MNCDP-GAN 提供差分隐私保护,但数据质量较低。

ABSTRACT

Due to confidentiality issues, it can be difficult to access or share interesting datasets for methodological development in actuarial science, or other fields where personal data are important. We show how to design three different types of generative adversarial networks (GANs) that can build a synthetic insurance dataset from a confidential original dataset. The goal is to obtain synthetic data that no longer contains sensitive information but still has the same structure as the original dataset and retains the multivariate relationships. In order to adequately model the specific characteristics of insurance data, we use GAN architectures adapted for multi-categorical data: a Wassertein GAN with gradient penalty (MC-WGAN-GP), a conditional tabular GAN (CTGAN) and a Mixed Numerical and Categorical Differentially Private GAN (MNCDP-GAN). For transparency, the approaches are illustrated using a public dataset, the French motor third party liability data. We compare the three different GANs on various aspects: ability to reproduce the original data structure and predictive models, privacy, and ease of use. We find that the MC-WGAN-GP synthesizes the best data, the CTGAN is the easiest to use, and the MNCDP-GAN guarantees differential privacy.

研究动机与目标

  • 为解决方法论研究中受限于保密的财产与意外伤害保险数据集访问的问题。
  • 开发并比较基于 GAN 的方法,以生成保留真实索赔数据统计结构和关系的合成数据。
  • 评估在精算数据合成中,数据保真度、隐私保障与实现便捷性之间的权衡。
  • 提供一个可复现、开源的框架,用于为公众生成合成保险数据集。

提出的方法

  • 将多类别 WGAN-GP(MC-WGAN-GP)适配于离散型和混合类型保险数据,采用梯度惩罚以提升训练稳定性。
  • 采用条件表格 GAN(CTGAN)生成表格型保险数据,通过条件噪声注入提升样本多样性。
  • 提出 MNCDP-GAN,一种基于自编码器架构的差分隐私 GAN,以确保强隐私保障。
  • 使用法国机动车第三方责任保险(MTPL)数据集作为公开基准进行训练与评估。
  • 采用多项指标评估合成数据质量,包括单变量分布匹配、多变量关系保持以及预测模型一致性。
  • 通过泊松广义线性模型拟合并分析预测误差(MAE、MSE),比较真实数据与合成数据上的模型性能。

实验结果

研究问题

  • RQ1基于 GAN 的方法在多大程度上能够保留真实财产与意外伤害保险数据集的单变量与多变量统计结构?
  • RQ2在精算数据合成中,不同 GAN 架构在数据保真度、隐私保护与使用便捷性之间的权衡如何?
  • RQ3由 GAN 生成的合成数据能否支持可靠的模型训练与预测,其表现可通过下游任务的预测性能衡量吗?
  • RQ4差分隐私机制如何影响合成保险数据的质量与实用性?

主要发现

  • MC-WGAN-GP 生成的合成数据在单变量和多变量分布上最接近原始法国 MTPL 数据集,尤其在捕捉各类别群体中的索赔概率方面表现优异。
  • CTGAN 是最易使用的模型,尤其对 R 用户友好,且生成的合成数据质量高,仅次于 MC-WGAN-GP。
  • MNCDP-GAN 提供了强有力的差分隐私保障,但其生成的数据保真度最差,甚至在未启用隐私机制时亦然。
  • 平均而言,MC-WGAN-GP 在索赔数量预测中达到中位绝对误差(MAE)5.0(95% 置信区间:4.68–5.44)和均方误差(MSE)0.08(95% 置信区间:0.06–0.10),显著优于 CTGAN(MAE:10.8,MSE:0.38)和 MNCDP-GAN(MAE:32.8,MSE:3.36)。
  • MC-WGAN-GP 和 CTGAN 均准确再现了索赔数量为 1 的情况,但 MC-WGAN-GP 更好地捕捉了分布其余部分的形状。
  • CTGAN 在合成数据上的回归系数最接近真实数据,而 MC-WGAN-GP 仅在其中一个区域系数上表现出轻微偏差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。