[論文レビュー] Continual Learning for Unsupervised Anomaly Detection in Continuous Auditing of Financial Accounting Data
本論文は、継続的学習(CL)フレームワークを提案し、金融会計データの継続的監査における教師なし異常検出に応用する。自己符号化器を用い、経験再生(ER)と弾性重み正則化(EWC)を組み合わせることで、深刻な忘却を軽減する。本手法は、時間の経過に伴い変化する仕訳明細の分布に関する知識を保持することで、誤検出と見逃しを低減し、実世界のデータセットにおいてベースラインを上回る性能を示す。
International audit standards require the direct assessment of a financial statement's underlying accounting journal entries. Driven by advances in artificial intelligence, deep-learning inspired audit techniques emerged to examine vast quantities of journal entry data. However, in regular audits, most of the proposed methods are applied to learn from a comparably stationary journal entry population, e.g., of a financial quarter or year. Ignoring situations where audit relevant distribution changes are not evident in the training data or become incrementally available over time. In contrast, in continuous auditing, deep-learning models are continually trained on a stream of recorded journal entries, e.g., of the last hour. Resulting in situations where previous knowledge interferes with new information and will be entirely overwritten. This work proposes a continual anomaly detection framework to overcome both challenges and designed to learn from a stream of journal entry data experiences. The framework is evaluated based on deliberately designed audit scenarios and two real-world datasets. Our experimental results provide initial evidence that such a learning scheme offers the ability to reduce false-positive alerts and false-negative decisions.
研究の動機と目的
- 実世界の会計システムに一般的に見られる非ステーションリティ(非定常)な仕訳明細分布における不正検出の課題に対処すること。
- 継続的監査環境におけるストリーミング監査データを学習対象とする深層学習モデルにおける深刻な忘却を克服すること。
- 進化的に変化するデータ分布からの段階的学習を可能にすることで、教師なし異常検出の信頼性を向上させること。
- 継続的学習が、金融監査シナリオにおける誤検出および見逃しの意思決定を低減する有効性を実証すること。
提案手法
- 時間順に並べられた仕訳明細のストリーミングデータに対して段階的に学習する自己符号化器ベースの異常検出モデルを採用し、通常の仕訳パターンからの逸脱を検出する。
- 継続的学習中に事前に学習した知識を保持するために、経験再生(ER)と弾性重み正則化(EWC)を統合する。
- 再構成誤差を異常スコアとして使用し、誤差が大きいほど異常である可能性が高いと判断する。
- 2つの合成監査シナリオを設計:(1) 渐減する対象部門における段階的分布シフト、(2) 局所的およびグローバルな異常を注入し、検出のロバストネスをテストする。
- 時間順の仕訳明細バッチを用いてモデルを学習し、継続的監査ワークフローをシミュレートする。
- 再構成誤差の差分(異常と正常の差)を指標として用い、SEL(単一エポック学習)とJEL(統合埋め込み学習)をベースラインとして性能を評価する。
実験結果
リサーチクエスチョン
- RQ1継続的学習は、継続的監査環境で使用される教師なし異常検出に用いられる深層学習モデルにおける深刻な忘却を緩和できるか?
- RQ2変化する仕訳明細分布における異常検出において、継続的学習は、定常的学習と比較して誤検出アラートをどれほど低減できるか?
- RQ3変化するデータ分布において、希少または局所的な異常の検出能力を、継続的学習がどの程度維持できるか?
- RQ4経験再生、弾性重み正則化、微調整のうち、どのCL正則化手法が、異常検出の正確性と知識保持の両立において最良のトレードオフを達成するか?
主な発見
- 経験再生(ER)は、指数関数的減衰下でのフィラデルフィア支払いデータセットにおいて、誤検出差(ΔFP)が-1.08 ± 0.371と最低を記録した。
- 減少する部門シナリオでは、ERはベースラインのSELと比較して誤検出を1.08単位低減し、SFT(ΔFP = 1.82)やEWC(ΔFP = 2.03)を上回った。
- 異常仕訳シナリオでは、ERが最高の異常検出性能を示し、フィラデルフィアデータセットにおける局所的異常の再構成誤差差(ΔFN)は47.69 ± 6.482であった。
- ERは、減少する対象部門では再構成誤差を低く維持(2.24 ± 0.292)し、注入された異常に対しては誤差を増加(47.69 ± 6.482)させることで、誤検出リスクを低減した。
- 弾性重み正則化(EWC)は中程度の性能を示し、最も挑戦的とされる減衰設定下でΔFP = 2.03 ± 0.218を記録し、依然として忘却が顕著に見られた。
- ベースラインのSEL手法は両シナリオで劣悪な性能を示し、誤検出差が顕著に高かった(例:ΔFP = 1.45 ± 0.115)、かつ異常検出感度が低かった(例:ℒRec(A_P1) = 7.03 ± 0.130)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。