[论文解读] Federated Continual Learning to Detect Accounting Anomalies in Financial Auditing
本文提出了一种用于金融审计中检测会计异常的联邦持续学习(FCL)框架,实现了在动态客户端环境中去中心化、隐私保护且自适应的模型训练。该方法结合联邦学习以聚合来自各客户端的模型,并结合持续学习以缓解灾难性遗忘,在存在数据分布偏移的真实审计场景中,实现了高达99.84%的全局异常检测精确率。
The International Standards on Auditing require auditors to collect reasonable assurance that financial statements are free of material misstatement. At the same time, a central objective of Continuous Assurance is the real-time assessment of digital accounting journal entries. Recently, driven by the advances in artificial intelligence, Deep Learning techniques have emerged in financial auditing to examine vast quantities of accounting data. However, learning highly adaptive audit models in decentralised and dynamic settings remains challenging. It requires the study of data distribution shifts over multiple clients and time periods. In this work, we propose a Federated Continual Learning framework enabling auditors to learn audit models from decentral clients continuously. We evaluate the framework's ability to detect accounting anomalies in common scenarios of organizational activity. Our empirical results, using real-world datasets and combined federated continual learning strategies, demonstrate the learned model's ability to detect anomalies in audit settings of data distribution shifts.
研究动机与目标
- 解决在数据分布持续演变的去中心化、动态组织环境中训练自适应、隐私保护审计模型的挑战。
- 缓解持续学习环境中灾难性遗忘的问题,即审计模型在学习新财务模式的同时仍需保留对过去财务模式的知识。
- 通过处理多个审计客户端之间的客户端特定数据分布偏移,减少联邦学习中的模型干扰。
- 评估结合FCL策略在涉及时间维度和客户端维度数据分布偏移的真实金融审计场景中的有效性。
- 证明FCL能够在持续保证环境中实现准确、实时的会计异常检测。
提出的方法
- 该框架采用联邦学习设置,由中央服务器协调从多个去中心化审计客户端聚合模型,从而保护数据隐私。
- 在每个客户端应用持续学习技术——回放(Replay)、类增量学习知识蒸馏(LwF)和经验回放正则化(EWC)——以防止随时间推移的增量学习中发生灾难性遗忘。
- 系统集成FedProx、Scaffold和FedYogi作为联邦优化策略,以减少由客户端数据分布偏移引起的模型干扰。
- 采用基于自编码器的异常检测模型,通过高重建误差识别潜在的会计异常分录。
- 使用平均精确率(AP)在多个真实城市政府数据集的全局和本地异常检测任务上评估模型性能。
- 实验通过五组随机种子组合联邦学习(FL)与持续学习(CL)策略,以确保结果稳健性并报告结果的方差。
实验结果
研究问题
- RQ1联邦持续学习框架能否在存在数据分布偏移的去中心化、动态审计环境中有效检测会计异常?
- RQ2在从顺序审计数据中学习时,不同的持续学习策略(Replay、LwF、EWC)在缓解灾难性遗忘方面的表现如何比较?
- RQ3联邦优化策略(FedProx、Scaffold、FedYogi)在多大程度上减少了由客户端特定数据分布偏移引起的模型干扰?
- RQ4在存在时间维度和客户端维度分布偏移的真实审计数据集中,哪种FL与CL策略组合能实现最高的异常检测精确率?
- RQ5在FCL设置下,模型性能在不同异常类别和AEN模型大小下如何变化?
主要发现
- 在费城城市数据集上,FedProx与EWC结合策略实现了99.84% ± 2.97的最高全局异常检测精确率,显著优于FedAvg-Sequential基线模型。
- 在费城数据集上,FedProx与回放(Replay)策略结合实现了74.11% ± 9.34的全局AP,表明其在稳定性上优于顺序微调和基线FedAvg。
- 在费城数据集上,Scaffold与顺序微调结合实现了93.39% ± 4.23的全局AP,表明其在管理异构客户端模型收敛方面具有有效性。
- 在纽约市数据集上,FedProx与EWC结合实现了87.67% ± 3.11的全局AP,表明即使在较小的AEN模型和稀疏数据条件下也表现出色。
- 在芝加哥数据集上,FedProx与LwF结合实现了76.18% ± 5.81的全局AP,表明其在处理客户端间分布偏移方面具有鲁棒性。
- 在所有数据集中,FCL框架缩小了联邦学习与单客户端学习之间的性能差距,表明其有效缓解了灾难性遗忘与模型干扰。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。