[論文レビュー] Kernel Based Sequential Data Anomaly Detection in Business Process Event Logs
本稿では、kNNおよび正規化最長共通部分列(nLCS)類似度を用いて、ビジネスプロセスのイベントログにおける外れ値を特定する、非教師ありカーネルベースの異常検出手法を提案する。実世界のインcidェント管理データセット上で評価された結果、高い正確性で異常ケースを効果的に検出でき、カーネルベースの順序付きデータモデリングが、従来の手法を凌駕するプロセスマイニングにおける異常検出を向上させることを示した。
Business Process Management Systems (BPMS) log events and traces of activities during the execution of a process. Anomalies are defined as deviation or departure from the normal or common order. Anomaly detection in business process logs has several applications such as fraud detection and understanding the causes of process errors. In this paper, we present a novel approach for anomaly detection in business process logs. We model the event logs as a sequential data and apply kernel based anomaly detection techniques to identify outliers and discordant observations. Our technique is unsupervised (does not require a pre-annotated training dataset), employs kNN (k-nearest neighbor) kernel based technique and normalized longest common subsequence (LCS) similarity measure. We conduct experiments on a recent, large and real-world incident management data of an enterprise and demonstrate that our approach is effective.
研究の動機と目的
- ビジネスプロセスイベントログにおける外れ値を特定するため、この分野でこれまでに適用されていなかった、カーネルベースの順序付きデータ異常検出技術を調査すること。
- 大規模で実世界のインシデント管理データセットを用いて、提案手法の有効性を裏付ける包括的な実証的分析を実施すること。
- プロセスマイニングにおける異常検出のための再現可能でオープンソースのソリューションを提供し、ベンチマークおよび今後の研究を支援すること。
- 類似度カーネルの選択(例:nLCS)およびkNNパラメータ(K)が検出結果に顕著な影響を及ぼすことを示すこと。
提案手法
- 各トレースを活動の順序付き列として表現することで、ビジネスプロセスイベントログを順序付きデータとしてモデル化する。
- 正規化最長共通部分列(nLCS)を類似度測定として用いるkNNベースのカーネル手法を適用し、異常スコアを計算する。
- シーケンス空間内でのk番目の近隣者までの平均距離を測定することで、異常スコアを算出する。
- カーネル密度推定およびzスコアを用いて、極端な値を潜在的な異常と特定する。
- DISCOを用いて発見されたプロセスモデルと比較することで、検出された異常を検証し、頻度が低いケースバリアントに注目する。
- zスコアおよびヒストグラム分析を用いて、異常スコアの分布を評価し、上位の外れ値を同定する。
実験結果
リサーチクエスチョン
- RQ1教師なしのラベル付き学習データを必要としないカーネルベースの順序付きデータ異常検出技術は、ビジネスプロセスイベントログにおける外れ値を効果的に特定できるか?
- RQ2類似度カーネルの選択(例:nLCS)は、順序付きプロセストレースにおける異常検出の性能および信頼性にどのように影響するか?
- RQ3kNNパラメータ(K)の異なる値は、実世界のプロセスログにおける異常ケース検出にどのように影響するか?
- RQ4本手法で検出された異常は、DISCOなどのプロセスマイニングツールで同定された頻度が低いまたは逸脱したケースバリアントと一致するか?
- RQ5実世界のログにおける異常スコアの分布は、ガウス型のパターンに従うか?これにより統計的しきい値設定が可能になるか?
主な発見
- nLCS類似度を用いた提案されたkNNカーネルベースの手法は、大規模な実世界のインシデント管理データセットにおいて異常ケースを効果的に検出でき、上位の異常スコアは最大4.582に達した。
- K=5000の場合、異常スコアの分布はガウス型に近く、平均1.7692、標準偏差0.2823であり、zスコアによる統計的しきい値設定が可能となった。
- 上位5件の異常スコア(4.582、4.127、4.106、3.464、3.325)は、zスコアが最大9.966に達するほど、平均から著しく逸脱していた。
- 本手法は5件の主要な異常トレースを同定した。そのうち1件は繰り返しの活動列(例:35;35;35;35;9;25;25;25;1;27;...)を示しており、DISCOプロセスモデルで頻度が低いケースバリアントとして正当化された。
- 1件あたりのイベント数およびケースバリアントの分布は正の歪度を示しており、大多数のケースは短いが、一部の長く複雑なケースは異常である可能性が高くなる傾向がある。
- 本研究では、カーネル類似度測定(nLCS)およびkNNパラメータ(K)が検出結果に顕著な影響を及ぼすことが確認され、ハイパーパramータチューニングの重要性が強調された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。