Skip to main content
QUICK REVIEW

[论文解读] Markov model with machine learning integration for fraud detection in health insurance

Rohan Yashraj Gupta, Satya Sai Mudigonda|arXiv (Cornell University)|Feb 11, 2021
Imbalanced Data Classification Techniques参考文献 20被引用 7
一句话总结

该论文提出了一种混合欺诈检测模型,通过将马尔可夫模型与梯度提升相结合,以提高准确率并减少误报。基于包含382,587条索赔记录(其中38,082条为欺诈性)的数据集,改进后的模型实现了97.10%的准确率和0.8546的F1分数,显著优于独立的马尔可夫模型(准确率为94.07%,F1分数为0.6683)。

ABSTRACT

Fraud has led to a huge addition of expenses in health insurance sector in India. The work is aimed to provide methods applied to health insurance fraud detection. The work presents two approaches - a markov model and an improved markov model using gradient boosting method in health insurance claims. The dataset 382,587 claims of which 38,082 claims are fraudulent. The markov based model gave the accuracy of 94.07% with F1-score at 0.6683. However, the improved markov model performed much better in comparison with the accuracy of 97.10% and F1-score of 0.8546. It was observed that the improved markov model gave much lower false positives compared to markov model.

研究动机与目标

  • 通过数据驱动的检测方法应对印度日益增长的健康保险欺诈财务负担。
  • 开发一种针对健康保险数据中索赔序列模式的马尔可夫模型。
  • 通过将梯度提升与马尔可夫模型结合,提升欺诈检测性能。
  • 与传统马尔可夫模型相比,降低误报率。
  • 评估混合机器学习与概率建模在真实世界保险索赔数据上的有效性。

提出的方法

  • 使用马尔可夫链对索赔序列进行建模,以捕捉索赔相关事件之间的状态转移。
  • 应用梯度提升框架(XGBoost)基于从马尔可夫模型中提取的特征来优化预测结果。
  • 使用包含382,587条索赔记录的数据集,其中包含38,082起欺诈案件,用于模型的训练与验证。
  • 在索赔转移概率上训练马尔可夫模型,并将其输出作为梯度提升模型的输入特征。
  • 通过在训练集上进行超参数调优与交叉验证来优化模型性能。
  • 使用标准指标(准确率、F1分数和误报率)对模型进行评估。

实验结果

研究问题

  • RQ1马尔可夫模型能否有效捕捉健康保险索赔中的序列模式以用于欺诈检测?
  • RQ2与仅使用马尔可夫模型相比,将梯度提升与马尔可夫模型结合后,检测准确率和F1分数的提升程度如何?
  • RQ3该混合模型在欺诈检测中将误报率降低到何种程度?
  • RQ4该混合模型在高欺诈率的真实印度健康保险索赔数据集上的表现如何?
  • RQ5从马尔可夫状态转移中提取的特征表示在多大程度上提升了梯度提升模型的性能?

主要发现

  • 独立的马尔可夫模型在健康保险索赔数据集上实现了94.07%的准确率和0.6683的F1分数。
  • 结合梯度提升的改进型马尔可夫模型实现了97.10%的准确率,相较于基线模型提升了3.03个百分点。
  • 混合模型的F1分数达到0.8546,较马尔可夫模型的0.6683有显著提升,表明其在精确率与召回率之间实现了更好的平衡。
  • 改进后的模型相比独立马尔可夫模型表现出显著更低的误报率,从而提升了实际可用性。
  • 将梯度提升与马尔可夫状态特征相结合,显著提升了检测性能,尤其在识别复杂欺诈模式方面表现突出。
  • 结果证实,将概率建模与集成机器学习相结合,可在健康保险欺诈检测中取得更优效果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。