[论文解读] Continual Learning for Unsupervised Anomaly Detection in Continuous Auditing of Financial Accounting Data
该论文提出了一种持续学习(CL)框架,用于在金融会计数据的连续审计中进行无监督异常检测,采用带有经验回放(ER)和弹性权重整合(EWC)的自编码器以缓解灾难性遗忘。该方法通过保留随时间演变的凭证条目分布知识,减少了误报和漏报,在真实世界数据集上优于基线模型。
International audit standards require the direct assessment of a financial statement's underlying accounting journal entries. Driven by advances in artificial intelligence, deep-learning inspired audit techniques emerged to examine vast quantities of journal entry data. However, in regular audits, most of the proposed methods are applied to learn from a comparably stationary journal entry population, e.g., of a financial quarter or year. Ignoring situations where audit relevant distribution changes are not evident in the training data or become incrementally available over time. In contrast, in continuous auditing, deep-learning models are continually trained on a stream of recorded journal entries, e.g., of the last hour. Resulting in situations where previous knowledge interferes with new information and will be entirely overwritten. This work proposes a continual anomaly detection framework to overcome both challenges and designed to learn from a stream of journal entry data experiences. The framework is evaluated based on deliberately designed audit scenarios and two real-world datasets. Our experimental results provide initial evidence that such a learning scheme offers the ability to reduce false-positive alerts and false-negative decisions.
研究动机与目标
- 解决在真实世界会计系统中常见的非平稳凭证条目分布下检测欺诈的挑战。
- 克服在连续审计环境中,对流式审计数据进行训练的深度学习模型所面临的灾难性遗忘问题。
- 通过使模型能够从随时间演变的数据分布中持续学习,提高无监督异常检测的可靠性。
- 展示持续学习在减少金融审计场景中误报和漏报决策方面的有效性。
提出的方法
- 采用基于自编码器的异常检测模型,对流式凭证条目进行增量训练,以检测与正常记账模式的偏差。
- 集成经验回放(ER)和弹性权重整合(EWC),在持续训练过程中保留先前学习到的知识。
- 使用重构损失作为异常评分,其中更高的损失表示可能存在异常。
- 设计两种合成审计场景:(1) 目标部门逐渐衰减的场景,存在渐进式分布偏移;(2) 注入局部和全局异常,以测试检测的鲁棒性。
- 使用代表时间有序凭证条目的增量数据批次进行模型训练,模拟连续审计工作流。
- 使用重构损失在异常条目与正常条目之间的差异作为评估指标,以单次训练学习(SEL)和联合嵌入学习(JEL)作为基线模型。
实验结果
研究问题
- RQ1持续学习能否缓解用于连续审计中无监督异常检测的深度学习模型的灾难性遗忘?
- RQ2在检测随时间演变的凭证条目分布中的异常时,持续学习相较于静态训练在减少误报警报方面表现如何?
- RQ3在数据分布发生偏移的情况下,持续学习在多大程度上能够保持对罕见或局部异常的检测能力?
- RQ4在经验回放、弹性权重整合和微调这三种CL正则化技术中,哪一种在异常检测准确率与知识保留之间取得了最佳平衡?
主要发现
- 在费城付款数据集上,经验回放(ER)实现了最低的误报差异,指数衰减条件下ΔFP为-1.08 ± 0.371。
- 在目标部门衰减场景中,ER相比基线SEL将误报减少了1.08个单位,优于SFT(ΔFP = 1.82)和EWC(ΔFP = 2.03)。
- 在异常凭证条目场景中,ER实现了最高的异常检测性能,费城数据集中局部异常的重构损失差异(ΔFN)为47.69 ± 6.482。
- ER通过在衰减目标部门维持低重构损失(2.24 ± 0.292)的同时,对注入的异常提高损失(47.69 ± 6.482),降低了误报风险。
- 弹性权重整合(EWC)表现中等,最具有挑战性的衰减设置下ΔFP = 2.03 ± 0.218,表明仍存在持续遗忘。
- 基线SEL方法在两种场景中表现均较差,误报差异较高(如ΔFP = 1.45 ± 0.115),且异常检测灵敏度较低(如ℒRec(A_P1) = 7.03 ± 0.130)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。