Skip to main content
QUICK REVIEW

[論文レビュー] Process Discovery using Inductive Miner and Decomposition

Raji Ghawi|arXiv (Cornell University)|Oct 25, 2016
Business Process Modeling and Analysis参考文献 3被引用数 14
ひとこと要約

本論文は、ProM内でのインダクティブマイナーと分解手法を組み合わせたハイブリッドアプローチを提示し、イベントログからのビジネスプロセスモデル抽出における過学習と不足学習のバランスを図ることを目的としている。この手法はテストデータで96%のトレース分類精度を達成し、BPM2016プロセス発見コンテストで2位を獲得した。

ABSTRACT

This report presents a submission to the Process Discovery Contest. The contest is dedicated to the assessment of tools and techniques that discover business process models from event logs. The objective is to compare the efficiency of techniques to discover process models that provide a proper balance between "overfitting" and "underfitting". In the context of the Process Discovery Contest, process discovery is turned into a classification task with a training set and a test set; where a process model needs to decide whether traces are fitting or not. In this report, we first show how we use two discovery techniques, namely: Inductive Miner and Decomposition, to discover process models from the training set using ProM tool. Second, we show how we use replay results to 1) check the rediscoverability of models, and to 2) classify unseen traces (in test logs) as fitting or not. Then, we discuss the classification results of validation logs, the complexity of discovered models, and their impact on the selection of models for submission. The report ends with the pictures of the submitted process models.

研究の動機と目的

  • イベントログから導出されるビジネスプロセスモデルにおける過学習と不足学習のバランスをとる、頑健なプロセス発見手法の開発。
  • インダクティブマイナーと分解手法を組み合わせることで、モデルの一般化性能と再発見可能性を向上させる有効性の評価。
  • 複雑さの指標を根拠に、検証およびテストログにおける分類性能に基づくモデル選択の最適化。
  • BPM2016プロセス発見コンテストへの高精度なプロセスモデルの提出により、トレース分類において上位水準のパフォーマンスを達成すること。
  • 再実行技術を活用してモデル適合度を検証し、未観測トレースを正確に適合・非適合に分類すること。

提案手法

  • ProM Liteを用いて、トレーニングイベントログから整合的でブロック構造を持つワークフロー・ネットモデルを発見するため、インダクティブマイナーを適用した。
  • ProM 6.5.1を介して実装された、構造的複雑性の高い複雑なプロセスをモデル化するための、分解に基づくプロセスマイニングを用いた。
  • 再実行分析を用いて再発見可能性を検証した(発見されたモデルがすべてトレーニングトレースを生成することを保証)。
  • 再実行の結果を活用して、検証およびテストログ内の未観測トレースを、モデル適合性に基づき適合または非適合に分類した。
  • 拡張カルドソメトリック指標(ECaM)、拡張サイクロマティック指標(ECyM)、構造的整合性指標(SM)を含む指標を用いて、モデルの複雑さを評価した。
  • Occamの剃刀の原則に従い、分類性能が同等の場合、より単純なインダクティブマイナーのモデルを最終モデルとして選択した。

実験結果

リサーチクエスチョン

  • RQ1インダクティブマイナーと分解を組み合わせたハイブリッドモデル発見アプローチは、プロセスマイニングにおける過学習と不足学習のバランスをどの程度効果的にとれるか?
  • RQ2インダクティブマイナーと分解手法は、イベントログ内のトレーニングトレースの再発見をどの程度保証するか?
  • RQ3モデルの複雑さ指標(例:SM、ECaM、ECyM)は、未観測テストトレースにおける分類性能とどの程度相関するか?
  • RQ4真のモデルが存在しない状況において、複雑さと検証結果に基づくモデル選択は、分類精度を向上させ得るか?
  • RQ5プロセス発見コンテストにおける一般化性能に、モデルの単純さがどのような影響を与えるか?

主な発見

  • ハイブリッドモデル選択アプローチは、6月のテストログで200件中192件の正しく分類されたトレースを達成し、96%の正確性を示した。
  • インダクティブマイナーのモデルは、平均構造的整合性指標(SM)が6,557.44と著しく低く、分解モデルの54,856.5よりも単純であった。
  • ログ1、2、4、9において、インダクティブマイナーのモデルは分解モデルを上回るか同等の分類性能を示したが、はるかに単純であった。
  • ログ8のモデル(インダクティブマイナーで発見)は、20件中17件の否定的トレースを正しく分類し、非適合行動の拒否精度が優れていた。
  • ログ10のモデル(分解により発見)は20件すべての正しく分類され、構造的整合性指標(SM = 16,435)が高くても高いパフォーマンスを示した。
  • 最終提出はBPM2016プロセス発見コンテストで14チーム中2位を獲得し、ハイブリッドアプローチおよびモデル選択戦略の有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。