[论文解读] Anti-Money Laundering Alert Optimization Using Machine Learning with Graphs
本文提出了一种机器学习分诊模型,通过结合以实体为中心的特征与基于图的特征(源自交易网络),显著降低了反洗钱(AML)系统中的误报率。基于真实银行数据集,该模型在保持超过90%真正例检测率的同时,将误报率降低了80%,显著提升了运营效率,且未牺牲基于规则的可解释性。
Money laundering is a global problem that concerns legitimizing proceeds from serious felonies (1.7-4 trillion euros annually) such as drug dealing, human trafficking, or corruption. The anti-money laundering systems deployed by financial institutions typically comprise rules aligned with regulatory frameworks. Human investigators review the alerts and report suspicious cases. Such systems suffer from high false-positive rates, undermining their effectiveness and resulting in high operational costs. We propose a machine learning triage model, which complements the rule-based system and learns to predict the risk of an alert accurately. Our model uses both entity-centric engineered features and attributes characterizing inter-entity relations in the form of graph-based features. We leverage time windows to construct the dynamic graph, optimizing for time and space efficiency. We validate our model on a real-world banking dataset and show how the triage model can reduce the number of false positives by 80% while detecting over 90% of true positives. In this way, our model can significantly improve anti-money laundering operations.
研究动机与目标
- 降低基于规则的AML系统中过高的误报率,目前该比率超过95%,导致调查人员面临过重的工作负担。
- 开发一种位于现有规则下游运行的机器学习分诊模型,保持可解释性的同时提升警报的优先级排序或抑制能力。
- 整合以实体为中心的行为特征与捕捉实体间关系的图特征,以增强对可疑活动的检测能力。
- 通过使用滑动时间窗口进行动态图构建,优化计算效率,特别是降低合法实体的内存开销。
- 在真实世界银行数据集上评估模型,涵盖可疑活动报告中的标签延迟等现实条件。
提出的方法
- 分诊模型是一个基于规则型AML系统生成的警报进行训练的监督机器学习分类器,特征从交易数据中工程化提取。
- 以实体为中心的特征包括在多个时间段(1天至2个月)内对交易金额和交易量进行时间窗口聚合(总和、均值、计数、最小值、最大值)。
- 图特征包括基于度的指标(如连接数)以及一种新颖的延迟标签适配版GuiltyWalker——一种基于随机游走的特征,用于检测与已知非法实体的接近程度。
- 采用滑动窗口机制以高效维护动态图,对可疑账户保留更长的记忆周期,以降低计算成本。
- 通过梯度提升树模型中的置换重要性进行特征选择,仅保留对性能贡献达90%的特征。
- 使用召回率@20%FPR作为主要评估指标,支持警报抑制或优先级排序策略。
实验结果
研究问题
- RQ1机器学习分诊模型是否能在保持基于规则系统可解释性的同时,降低AML系统中的误报率?
- RQ2图特征(尤其是基于度的特征和GuiltyWalker变体)在提升AML检测能力方面,相较于传统以实体为中心的特征有多显著?
- RQ3可疑活动报告中的标签延迟在多大程度上影响图特征(如GuiltyWalker)的性能?
- RQ4使用滑动时间窗口进行动态图构建,是否能在降低内存和计算成本的同时保持模型性能?
- RQ5以实体为中心与图特征的最佳组合是什么,能够在最大化真正例检测率的同时最小化误报率?
主要发现
- 分诊模型在保留超过90%真正例的同时,将误报率降低了80%,在警报抑制方面表现出色。
- 引入图特征(尤其是基于度的特征)显著提升了模型性能,超越仅使用以实体为中心特征的情况。
- GuiltyWalker特征的新型延迟标签版本仍对检测有帮助,但性能相比非延迟版本有所下降。
- 当与基于度的特征结合时,GuiltyWalker特征的增益减弱,表明数据集中存在信息重叠。
- 通过为可疑账户保留更长记忆周期、为合法账户保留更短记忆周期,模型的计算效率得到提升,降低了系统负载。
- 模型在召回率@20%FPR方面表现良好,支持在真实AML运营中实际部署于警报抑制、优先级排序或混合策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。