Skip to main content
QUICK REVIEW

[论文解读] Anti-Money Laundering Alert Optimization Using Machine Learning with Graphs

Ahmad Naser Eddin, Jacopo Bono|arXiv (Cornell University)|Dec 14, 2021
Crime, Illicit Activities, and Governance被引用 12
一句话总结

本文提出了一种机器学习分诊模型,通过结合以实体为中心的特征与基于图的特征(源自交易网络),显著降低了反洗钱(AML)系统中的误报率。基于真实银行数据集,该模型在保持超过90%真正例检测率的同时,将误报率降低了80%,显著提升了运营效率,且未牺牲基于规则的可解释性。

ABSTRACT

Money laundering is a global problem that concerns legitimizing proceeds from serious felonies (1.7-4 trillion euros annually) such as drug dealing, human trafficking, or corruption. The anti-money laundering systems deployed by financial institutions typically comprise rules aligned with regulatory frameworks. Human investigators review the alerts and report suspicious cases. Such systems suffer from high false-positive rates, undermining their effectiveness and resulting in high operational costs. We propose a machine learning triage model, which complements the rule-based system and learns to predict the risk of an alert accurately. Our model uses both entity-centric engineered features and attributes characterizing inter-entity relations in the form of graph-based features. We leverage time windows to construct the dynamic graph, optimizing for time and space efficiency. We validate our model on a real-world banking dataset and show how the triage model can reduce the number of false positives by 80% while detecting over 90% of true positives. In this way, our model can significantly improve anti-money laundering operations.

研究动机与目标

  • 降低基于规则的AML系统中过高的误报率,目前该比率超过95%,导致调查人员面临过重的工作负担。
  • 开发一种位于现有规则下游运行的机器学习分诊模型,保持可解释性的同时提升警报的优先级排序或抑制能力。
  • 整合以实体为中心的行为特征与捕捉实体间关系的图特征,以增强对可疑活动的检测能力。
  • 通过使用滑动时间窗口进行动态图构建,优化计算效率,特别是降低合法实体的内存开销。
  • 在真实世界银行数据集上评估模型,涵盖可疑活动报告中的标签延迟等现实条件。

提出的方法

  • 分诊模型是一个基于规则型AML系统生成的警报进行训练的监督机器学习分类器,特征从交易数据中工程化提取。
  • 以实体为中心的特征包括在多个时间段(1天至2个月)内对交易金额和交易量进行时间窗口聚合(总和、均值、计数、最小值、最大值)。
  • 图特征包括基于度的指标(如连接数)以及一种新颖的延迟标签适配版GuiltyWalker——一种基于随机游走的特征,用于检测与已知非法实体的接近程度。
  • 采用滑动窗口机制以高效维护动态图,对可疑账户保留更长的记忆周期,以降低计算成本。
  • 通过梯度提升树模型中的置换重要性进行特征选择,仅保留对性能贡献达90%的特征。
  • 使用召回率@20%FPR作为主要评估指标,支持警报抑制或优先级排序策略。

实验结果

研究问题

  • RQ1机器学习分诊模型是否能在保持基于规则系统可解释性的同时,降低AML系统中的误报率?
  • RQ2图特征(尤其是基于度的特征和GuiltyWalker变体)在提升AML检测能力方面,相较于传统以实体为中心的特征有多显著?
  • RQ3可疑活动报告中的标签延迟在多大程度上影响图特征(如GuiltyWalker)的性能?
  • RQ4使用滑动时间窗口进行动态图构建,是否能在降低内存和计算成本的同时保持模型性能?
  • RQ5以实体为中心与图特征的最佳组合是什么,能够在最大化真正例检测率的同时最小化误报率?

主要发现

  • 分诊模型在保留超过90%真正例的同时,将误报率降低了80%,在警报抑制方面表现出色。
  • 引入图特征(尤其是基于度的特征)显著提升了模型性能,超越仅使用以实体为中心特征的情况。
  • GuiltyWalker特征的新型延迟标签版本仍对检测有帮助,但性能相比非延迟版本有所下降。
  • 当与基于度的特征结合时,GuiltyWalker特征的增益减弱,表明数据集中存在信息重叠。
  • 通过为可疑账户保留更长记忆周期、为合法账户保留更短记忆周期,模型的计算效率得到提升,降低了系统负载。
  • 模型在召回率@20%FPR方面表现良好,支持在真实AML运营中实际部署于警报抑制、优先级排序或混合策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。