Skip to main content
QUICK REVIEW

[论文解读] A Machine Learning-based Anomaly Detection Framework in Life Insurance Contracts

Andreas Groll, Akshat Khanna|arXiv (Cornell University)|Nov 26, 2024
Insurance and Financial Risk ManagementEconomics, Econometrics and Finance被引用 3
一句话总结

本文提出了一种基于机器学习的无监督异常检测框架,用于人寿保险合同,通过无监督方法识别未标记异常数据中的异常。该研究在两个开源数据集上评估了经典方法(如孤立森林和自编码器),结果表明深度学习模型——特别是变分自编码器——在检测人工注入的合同级异常方面表现更优,具有高准确率和高度自动化潜力。

ABSTRACT

Life insurance, like other forms of insurance, relies heavily on large volumes of data. The business model is based on an exchange where companies receive payments in return for the promise to provide coverage in case of an accident. Thus, trust in the integrity of the data stored in databases is crucial. One method to ensure data reliability is the automatic detection of anomalies. While this approach is highly useful, it is also challenging due to the scarcity of labeled data that distinguish between normal and anomalous contracts or inter\-actions. This manuscript discusses several classical and modern unsupervised anomaly detection methods and compares their performance across two different datasets. In order to facilitate the adoption of these methods by companies, this work also explores ways to automate the process, making it accessible even to non-data scientists.

研究动机与目标

  • 解决在缺乏或不存在标记异常的情况下检测人寿保险数据中异常的挑战。
  • 比较经典无监督方法(如k均值、DBSCAN、孤立森林、OCSVM)与现代深度学习模型(自编码器、VAE)在识别合同级异常方面的性能。
  • 开发一种自动化、非专家友好的异常检测流水线,以支持实际保险业务运营。
  • 通过人工注入异常来评估模型性能,以模拟保单级数据中的真实数据异常。
  • 为保险公司提供一种实用且可扩展的框架,以增强数据完整性并检测欺诈行为,而无需大量数据科学专业知识。

提出的方法

  • 采用无监督异常检测技术,包括基于邻近度的方法(k均值、DBSCAN、HDBSCAN)、基于树的孤立森林,以及一类支持向量机(OCSVM),以识别人寿保险数据集中的异常值。
  • 应用深度学习模型——自编码器(AEs)和变分自编码器(VAEs)——学习低维表示,并通过重构误差检测异常。
  • 使用网格搜索对孤立森林进行自动超参数调优(参数:f_max, s_max, n_estimators),而其他模型则需手动或通过实验调优。
  • 通过独热编码处理分类变量,并对数值特征进行标准化,以确保所有模型的兼容性。
  • 采用多种指标综合评估模型性能:在四个手动注入异常案例中检测到的异常数量、自编码器/变分自编码器的重构误差、孤立森林的异常得分,以及聚类方法的轮廓系数。
  • 采用基于阈值的分类方法:将重构误差高于固定阈值(AE为0.5,VAE为0.7)或异常得分高于学习到的截断值的实例识别为异常。
Figure 1 : An example representation of anomalous and normal points in an example data set with two variables, $X$ and $Y$ , taken from Chandola et al. ( 2009 ) .
Figure 1 : An example representation of anomalous and normal points in an example data set with two variables, $X$ and $Y$ , taken from Chandola et al. ( 2009 ) .

实验结果

研究问题

  • RQ1在缺乏标记数据的条件下,经典无监督异常检测方法(如孤立森林、OCSVM、k均值)在检测人寿保险数据中合同级异常方面的表现如何?
  • RQ2基于深度自编码器的模型(AEs 和 VAEs)在检测人寿保险数据集中的异常方面,相较于传统机器学习方法能提升多少性能?
  • RQ3自动化超参数调优是否能提升非专家场景下异常检测模型的鲁棒性和可复现性?
  • RQ4不同数据集上,模型运行时间和可扩展性如何变化,特别是在处理更大或更复杂数据结构时?
  • RQ5架构设计(如深度、潜在维度)对自编码器和变分自编码器在异常检测任务中的性能和效率有何影响?

主要发现

  • 变分自编码器(VAEs)实现了最高的检测率,在两个数据集中均成功识别出全部四个手动注入的异常,分别检测到548例和512例总异常。
  • 孤立森林在两个数据集中均优于经典方法,分别在数据集1和数据集2中检测出全部四个异常,总检测异常数分别为342例和1974例。
  • 自编码器在数据集1和数据集2中分别检测到224例和705例异常,成功识别出全部四个异常,且在数据集1上的训练时间不足3分钟。
  • 在数据集2上表现最佳的VAE模型采用学习率为1e-2、训练950个周期,潜在空间维度为10,实现了最高的异常检测召回率。
  • 经典方法如DBSCAN和HDBSCAN因计算负载过高而无法在数据集2上完成,运行时间超过5小时,而孤立森林和OCSVM均在10秒内完成。
  • 在数据集2上,VAE的重构误差阈值0.7为最优设置,经人工检查确认,该阈值在最大化真正例检测率的同时最小化了假正例。
Figure 2 : Proportion of anomalies and detected manual anomalies (secondary $y$ -axis).
Figure 2 : Proportion of anomalies and detected manual anomalies (secondary $y$ -axis).

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。