[論文レビュー] Prototype Selection Based on Clustering and Conformance Metrics for Model Discovery
本論文では、プロセストレースのクラスタリングを用いて、イベントログから代表的インスタンス(プロトタイプ)を同定するインクリメンタルなプロトタイプ選択手法を提案する。これらのプロトタイプは、より高品質なプロセスモデルの発見に使用される。制御フロー距離と適合性メトリクスに基づいて反復的にプロトタイプを選択することで、モデルの複雑さを増さずに、品質基準のバランスと適合性を向上させ、実世界のログにおいて、最先端のサンプリングおよびフィルタリング手法を上回る性能を発揮する。
Process discovery aims at automatically creating process models on the basis of event data captured during the execution of business processes. Process discovery algorithms tend to use all of the event data to discover a process model. This attitude sometimes leads to discover imprecise and/or complex process models that may conceal important information of processes. To address this problem, several techniques, from data filtering to model repair, have been elaborated in the literature. In this paper, we introduce a new incremental prototype selection algorithm based on clustering of process instances. The method aims to iteratively compute a unique process model with a different set of selected prototypes, i.e., representative of whole event data and stops when conformance metrics decrease. The proposed method has been implemented in both the ProM and the RapidProM platforms. We applied the proposed method on several real event data with state-of-the-art, process discovery algorithms. Results show that using the proposed method leads to improve the general quality of discovered process models.
研究の動機と目的
- 大規模で多様性のあるイベントログから、過剰に複雑で不正確なプロセスモデルを発見する課題に対処すること。
- 適合性、正確性、一般化性、単純さの間のバランスを、プロセス発見において向上させること。
- 発見アルゴリズムに依存しない、知的なプロトタイプ選択を通じてモデル品質を向上させる手法を開発すること。
- データのばらつきとモデルの複雑さを低減しながら、イベントログ内の本質的な行動パターンを保持すること。
- 適合性チェックを活用してプロトタイプ選択をガイドする、安定的でインクリメンタルなアプローチを提供すること。
提案手法
- 制御フロー距離を用いてプロセストレースをクラスタリングし、類似した行動パターンをグループ化する。
- 各クラスタの重心を代表的プロトタイプとして選択し、多様なプロセスバリアントをカバーする。
- 標準的な発見アルゴリズムを用いて、選択されたプロトタイプからプロセスモデルを発見する。
- 適合性メトリクスに従って、逸脱するトレースから新たなプロトタイプを反復的に追加し、適合性と正確性のバランスを取る。
- Fβ測定値を用いて、インクリメンタルな選択プロセスを評価・ガイドし、全体的な品質が優れたモデルを優遇する。
- このアプローチは ProM および RapidProM に実装されており、既存のプロセスマイニングツールやワークフローへの統合を可能にする。
実験結果
リサーチクエスチョン
- RQ1クラスタリングに基づくプロトタイプ選択は、全イベントログを用いる場合と比較して、発見されるプロセスモデルの品質をどのように向上させるか?
- RQ2インクリメンタルなプロトタイプ選択は、プロセスモデルにおける適合性、正確性、一般化性、単純さの間のバランスをどの程度向上させるか?
- RQ3プロトタイプ選択の段階で適合性メトリクスが使用されることで、モデル品質と安定性にどのような影響を与えるか?
- RQ4提案手法は、実世界のイベントログにおいて、既存のサンプリングおよびフィルタリング手法を上回る性能を示せるか?
- RQ5プロトタイプ選択戦略(頻度対クラスタリング)が、モデルの適合性と正確性に与える影響は何か?
主な発見
- Sepsisログにおいて、5%のトレースをクラスタリングにより選択したプロトタイプで、35%のトレースカバレッジを達成し、最小限のデータで高い適合性を実現した。
- 10個以上のプロトタイプを用いた場合、頻度ベースの選択と比較して、クラスタリングに基づくプロトタイプ選択手法が、より高いモデル適合性を達成した。特に、バリアント多様性の高いログでは顕著であった。
- ドライブログでは、頻度の高い主要なバリアントが支配的であるため、頻度ベースの選択が少ないプロトタイプ数で高いカバレッジを達成したが、複雑で多様性のあるログではクラスタリング手法が優れた性能を示した。
- 複数の実世界のイベントログと発見アルゴリズムにおいて、Fβ測定値で測定した適合性と正確性のバランスが向上した。
- 全ログに基づいて構築されたモデルと比較して、発見されたモデルは複雑さが低く、理解しやすかったが、観察された行動に高い適合性を維持した。
- パrameter設定にかかわらず安定した性能を示し、品質指標において、最先端のサンプリングおよびフィルタリング手法を一貫して上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。