[论文解读] A network and machine learning approach to detect Value Added Tax fraud
本文提出了一种新颖的机器学习框架,将网络科学与可扩展分类算法相结合,通过分析B2B交易网络的结构模式来检测增值税(VAT)欺诈。基于保加利亚的VAT数据,该方法检测到约50%已知的欺诈案例——显著优于忽略网络结构的传统技术——实现了大规模、早期的自动化欺诈识别。
Value Added Tax (VAT) fraud erodes public revenue and puts legitimate businesses at a disadvantaged position thereby impacting inequality. Identifying and combating VAT fraud before it occurs is therefore important for welfare. This paper proposes flexible machine learning algorithms which detect fraudulent transactions, utilising the information provided by the complex VAT network structure of a large dimension. VAT fraud detection is implemented through a combination of a suitably constructed Laplacian matrix with classification algorithms that rely on scalable machine learning techniques. The method is implemented on the universe of Bulgarian VAT data and detects around 50 percent of the VAT fraud, outperforming well-known techniques that ignore the information provided by the network of VAT transactions. Importantly, the proposed methods are automated, and can be implemented following the taxpayers submission of their VAT returns. This allows tax revenue authorities to prevent large losses of tax revenues through performing early identification of fraud between business-to-business transactions within the VAT system.
研究动机与目标
- 开发一种自动化、可扩展的增值税(VAT)欺诈检测系统,利用企业交易网络的结构特性。
- 通过整合纳税人个体行为与群体级网络模式,提升欺诈检测的准确性,克服传统方法的局限性。
- 在增值税申报提交过程中实现对欺诈性纳税人的早期识别,防止收入损失发生。
- 为税务机关提供一种实用、可部署的解决方案,通过最少的人工干预,优先对高风险纳税人进行审计。
- 针对欺诈行为的时序性与动态特性,提出未来多层网络模型的基础框架。
提出的方法
- 从VAT交易网络构建拉普拉斯矩阵,以编码企业之间的结构关系。
- 在源自网络拉普拉斯矩阵与个体纳税人行为的特征上应用可扩展的机器学习分类器(例如随机森林、梯度提升)。
- 采用两阶段算法:算法1基于网络与行为特征识别高风险纳税人;算法2通过额外的统计过滤进一步优化排名。
- 采用风险名单生成机制,按预测欺诈概率对纳税人进行排序,使监管机构能够优先开展审计。
- 使用保加利亚国家税务局的真实数据验证性能,并与基线方法比较检测率。
- 整合网络拓扑特征,如中心性、聚类系数与社区结构,以检测异常交易模式。
实验结果
研究问题
- RQ1如何利用B2B增值税交易中的网络结构,超越个体纳税人行为,提升欺诈检测能力?
- RQ2基于网络嵌入特征训练的机器学习模型,是否能比传统方法检测到更高比例的实际VAT欺诈?
- RQ3在使用自动化分类选择纳税人进行审计时,假阳性率与检测率之间的最优权衡是什么?
- RQ4将网络科学与机器学习相结合,如何增强大规模税务系统中欺诈检测的可扩展性与自动化水平?
- RQ5所提出的方法在多大程度上能够实现欺诈的提前识别,从而避免造成重大收入损失?
主要发现
- 所提出的方法在保加利亚数据集中检测到约50%的已知VAT欺诈案例,显著优于不使用网络结构的传统技术。
- 算法1在分类性能上优于算法2,尤其在最小化假阳性率的同时最大化新识别出的高风险纳税人检测率方面表现更优。
- 通过将报告的纳税人数量从200人减少至50人,该方法显著降低了假阳性率,其中40名被正确识别为2017年12月前已进入官方风险名单的纳税人。
- 若使用该方法对2,000名纳税人进行审计,可识别出多达140个高风险案例,展现出强大的可扩展性与预测能力。
- 该方法支持在增值税申报提交时实现自动化、实时的欺诈检测,助力主动审计。
- 结果表明,基于网络的特征显著提升了欺诈检测效果,凸显了交易网络中结构模式的重要价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。