[論文レビュー] Open ERP System Data For Occupational Fraud Detection
本稿では、通常の業務運用と現実的な職務上の詐欺シナリオを含む、公開可能な合成ERPシステムデータを生成する新規手法を提案する。著者たちは、実際のERPシステムにおけるユーザーのインタラクションをシミュレートするシリアスゲームを活用し、細分化された詐欺ラベルを備えた数年分にわたるデータセットを生成することで、企業資源計画環境における詐欺検出手法の再現可能性のあるベンチマーク評価を可能にする。
Recent estimates report that companies lose 5% of their revenue to occupational fraud. Since most medium-sized and large companies employ Enterprise Resource Planning (ERP) systems to track vast amounts of information regarding their business process, researchers have in the past shown interest in automatically detecting fraud through ERP system data. Current research in this area, however, is hindered by the fact that ERP system data is not publicly available for the development and comparison of fraud detection methods. We therefore endeavour to generate public ERP system data that includes both normal business operation and fraud. We propose a strategy for generating ERP system data through a serious game, model a variety of fraud scenarios in cooperation with auditing experts, and generate data from a simulated make-to-stock production company with multiple research participants. We aggregate the generated data into ready to used datasets for fraud detection in ERP systems, and supply both the raw and aggregated data to the general public to allow for open development and comparison of fraud detection approaches on ERP system data.
研究の動機と目的
- 職務上の詐欺検出研究のための公開可能なERPシステムデータの不足に対処すること。
- 通常の運用と多様な詐欺シナリオを含む現実的な合成ERPデータを生成すること。
- 生データおよび集計データの公開により、詐欺検出手法の再現可能性と比較可能性を確保すること。
- P2Pプロセスにとどまらず、O2Cプロセスを含めた範囲に広がる応用可能性を高めること。
- 検出モデルの評価に役立てるために、特徴レベルでの細分化された専門家による詐欺ラベルを提供すること。
提案手法
- 実際のERPシステムにおけるユーザーのインタラクションをシミュレートするシリアスゲームを用い、通常および不正な業務プロセスの両方を記録する。
- 監査専門家と協働して複数の職務上の詐欺シナリオをモデル化し、現実性と多様性を確保する。
- 数年間にわたる複数回のシミュレーション実行により、縦断的ERPデータを生成する。
- ERPシステムから生の取引データを抽出し、使用可能な形に集約する。
- 財務会計テーブルを結合して共同データセットを作成し、識別性のない詐欺事例を除外することでデータの整合性を保つ。
- 専門家レベルの特徴ラベリングを実施し、潜在的な詐欺事例を示す異常なカラム項目を特定する。
実験結果
リサーチクエスチョン
- RQ1シリアスゲームを用いることで、通常の運用と職務上の詐欺を含む現実的で公開可能なERPデータを効果的に生成できるか?
- RQ2合成ERPデータをどのように構造化すれば、詐欺検出アルゴリズムの再現可能なベンチマーク評価を可能にするか?
- RQ3検出性能の意味のある評価を可能にするために、どの程度の粒度の詐欺ラベリングが必要か?
- RQ4集計された財務会計レベルにおいて、ERPデータ内の詐欺事例は通常取引からどれほど区別可能か?
- RQ5O2CやP2Pのような複数のビジネスプロセスを統合的・オープンなデータセットとしてカバーするためのデータ生成戦略をどのように拡張できるか?
主な発見
- 著者たちは、シリアスゲームベースのシミュレーションにより、通常および不正取引を含む数年分のERPシステムデータを成功裏に生成した。
- 複数の会計年度にわたり、合計86件の詐欺事例が含まれており、最終的な共同データセットには50件の詐欺がラベル付けされた。
- 詐欺事例は、通常のデータの中のわずかな数個の異常なエントリを通じて検出可能であることが判明し、統計的異常検出手法の有効性を裏付けた。
- 専門家による特徴レベルのラベルが含まれているため、取引レベルでの詐欺検出性能の細分化された分析が可能になった。
- 最終的なデータセットは公開されており、生データおよび集計データの両方が含まれており、ERP詐欺検出分野におけるオープンかつ再現可能な研究を支援する。
- 本アプローチにより、O2CやP2Pを含む異なるビジネスプロセスにおける詐欺検出手法のベンチマーク評価が、現実的な詐欺シナリオを伴って可能になった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。