[論文レビュー] Unsupervised Event Abstraction using Pattern Abstraction and Local Process Models
本稿では、プロセス発見の前に、自動的に発見された局所的プロセスモデル(LPM)を活動パターンとして用いる非教師ありイベント抽象化手法を提案する。この手法により、低レベルのイベントログをより高い抽象化レベルに昇格させる。LPMをフィルタリングおよび適用することにより、発見されたプロセスモデルにおける適合性と正確性のバランスが向上し、BPI13-CログではFスコアが0.65から0.74に向上し、5つの実生活イベントログのうち3つで改善が観察された。
Process mining analyzes business processes based on events stored in event logs. However, some recorded events may correspond to activities on a very low level of abstraction. When events are recorded on a too low level of granularity, process discovery methods tend to generate overgeneralizing process models. Grouping low-level events to higher level activities, i.e., event abstraction, can be used to discover better process models. Existing event abstraction methods are mainly based on common sub-sequences and clustering techniques. In this paper, we propose to first discover local process models and then use those models to lift the event log to a higher level of abstraction. Our conjecture is that process models discovered on the obtained high-level event log return process models of higher quality: their fitness and precision scores are more balanced. We show this with preliminary results on several real-life event logs.
研究の動機と目的
- 低レベルのイベントログがプロセス発見において過剰に一般化され、不正確なプロセスモデルを生じさせることの問題に対処すること。
- 手動によるドメイン知識に依存するのを排除し、代わりに自動的に発見されたLPMを用いてイベント抽象化を行うこと。
- 教師なしでイベントログからより高いレベルの抽象化を発見することにより、プロセスモデルの品質を向上させること。
- LPMに基づく抽象化が、発見されたモデルにおける適合性と正確性のスコアのバランスを改善するかどうかを評価すること。
提案手法
- マーカフクラスタリングおよびLPMマイニング技術を用いて、元の低レベルイベントログから局所的プロセスモデル(LPM)を発見する。
- 多様性のしきい値に基づいて発見されたLPMの集合をフィルタリングし、代表的な行動パターンを保持する。
- フィルタリングされたLPMを活動パターンとして用い、元のイベントログをより高いレベルのログに抽象化する。低レベルイベントのシーケンスを高レベルの活動ラベルに置き換える。
- 抽象化された高レベルログに対して、標準的なプロセス発見アルゴリズム(例:IM infrequent)を適用し、洗練されたプロセスモデルを生成する。
- Fスコア(適合性と正確性の調和平均)を用いてモデルの品質を評価し、抽象化済みログと元のログの比較を行う。
- 公平な比較と解釈のため、発見された高レベルモデルに下位のLPMを統合する。
実験結果
リサーチクエスチョン
- RQ1イベントログから発見されたLPMが、非教師ありイベント抽象化のための活動パターンとして効果的に機能するか。
- RQ2自動的に発見されたLPMを用いてイベントログを抽象化することで、発見されたプロセスモデルの正確性と適合性のバランスが向上するか。
- RQ3LPMの数、多様性のしきい値、および構成方法(入れ違い vs. 並列)といったパrameterが、モデル品質に与える影響は何か。
- RQ4この抽象化技術の性能は、元のイベントログの特性に依存するか。
主な発見
- 抽象化されたBPI13-Cログから発見されたプロセスモデルのFスコアは、0.65から0.74に向上し、適合性と正確性のバランスが改善されたことを示している。
- 5つの実生活イベントログのうち3つについて、提案された抽象化手法により、元のログに対する直接的なプロセス発見よりも高いFスコアが得られた。
- 抽象化に使用する最適なLPMの数はログごとに異なり、BPI13-Cでは1つのLPMで十分であり、sepsisログでは5つのLPMが必要であった。
- LPMの並列構成は唯一のケースでのみモデル品質を向上させたため、実用的にはより効率的な入れ違い構成が好ましい可能性がある。
- BPI13-Cのモデルの正確性は0.53から0.86に上昇した一方で、適合性は0.84から0.65に低下した。これは、妥当な適合性の犠牲を伴いながらも、モデルの正確性が著しく向上したことを示している。
- 結果から、この抽象化技術の有効性はログ固有の特性とパrameter設定に強く依存しており、完全な自動化には自動パrameterチューニングが必要であると示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。