Skip to main content
QUICK REVIEW

[論文レビュー] Striking a new balance in accuracy and simplicity with the Probabilistic Inductive Miner

Dennis Brons, Roeland Scheepens|arXiv (Cornell University)|Sep 13, 2021
Business Process Modeling and Analysis参考文献 18被引用数 11
ひとこと要約

確率的誘導マイナー(PIM)は、トレース頻度に基づく確率的推論を用いてXORおよびANDゲートウェイを備えたブロック構造モデルを選択することで、モデルの正確性と単純さのバランスを取る新しいプロセス発見アルゴリズムを導入する。PIMは最先端の手法よりも高い正確性と低い複雑度を達成しており、明快さと信頼性の観点から産業界のアナリストに実証的に好まれている。

ABSTRACT

Numerous process discovery techniques exist for generating process models that describe recorded executions of business processes. The models are meant to generalize executions into human-understandable modeling patterns, notably parallelism, and enable rigorous analysis of process deviations. However, well-defined models with parallelism returned by existing techniques are often too complex or generalize the recorded behavior too strongly to be trusted in a practical business context. We bridge this gap by introducing the Probabilistic Inductive Miner (PIM) based on the Inductive Miner framework. PIM compares in each step the most probable operators and structures based on frequency information in the data, which results in block-structured models with significantly higher accuracy. All design choices in PIM are based on business context requirements obtained through a user study with industrial process mining experts. PIM is evaluated quantitatively and in an novel kind of empirical study comparing users' trust in discovered model structures. The evaluations show that PIM strikes a unique trade-off between model accuracy and model complexity, that is conclusively preferred by users over all state-of-the-art process discovery methods.

研究の動機と目的

  • 産業的プロセスマイニングの文脈において、モデル適合度、正確性、単純さの間の好ましいトレードオフを特定すること。
  • 既存のプロセス発見手法が過剰に一般化(正確性が低い)するか、またはあまりに複雑なモデルを生成する(単純さが低い)というギャップを埋めること。
  • 信頼性、明快さ、根拠に基づくモデリングという産業界の要件を満たすプロセス発見アルゴリズムを開発すること。
  • 高精度で低複雑度のモデルが、既存の手法よりも実務家に好まれるかどうかを評価すること。

提案手法

  • PIMは、XORおよびANDゲートウェイのみを備えたブロック構造モデルを保証するようにインダクティブマイナー枠組みを拡張し、構造的単純さの要件を満たす。
  • 再帰的段階ごとに、トレース頻度に基づく確率的推論を用いて最も可能性の高いプロセス演算子(並列性、ループなど)を特定する。
  • アルゴリズムは、最も頻度の高いk個のアクティビティのみを考慮し、頻度の低い行動を除外するための確率的閾値を適用するフィルタリング機構を組み込む。
  • PIMは、IMf(頻度フィルタリング)とIMc(確率的モデリング)の原則を統合し、正確性と複雑度のバランスを取る。
  • モデルの複雑度は設定可能なパラメータによって制御され、アナリストが詳細さと単純さの間でトレードオフを実現できる。
  • 実証的評価では、11名のプロフェッショナルを対象としたユーザースタディを実施し、モデルの信頼性と好みを評価した。参加者は、明快さと根拠に基づく構造の観点からモデルを評価した。

実験結果

リサーチクエスチョン

  • RQ1産業的プロセスマイニングの専門家は、プロセスモデル発見において、適合度、正確性、単純さのどのバランスを好むか?
  • RQ2インダクティブマイナー枠組みの確率的拡張は、十分なデータ根拠を保持しながらも、高精度かつ単純なモデルを生成できるか?
  • RQ3PIMで発見されたモデルは、IMf、SM、および他の最先端手法と比較して、より高いユーザートラストと好みを達成できるか?
  • RQ4ユーザーはPIMモデルに対して、データに十分な根拠があると認識し、実際の行動パターンを反映する構造を信頼するか?

主な発見

  • PIMはIMfよりも顕著に高い正確性を達成し、SMと同等のFスコアを記録したが、構造的複雑度は著しく低かった。
  • 実証的評価において、PIMは実際のデータセット2つ(InvoiceとBPIC17 cp)で参加者から最も良いモデルとして選ばれたのに対し、RTFMPではSMが選ばれた。
  • モデル選択の理由に関する書面の正当化の58.8%が、単純さ、明快さ、または読みやすさを理由としてPIMを選んだと述べた。
  • 参加者たちはPIMモデルを、SMやIMfのモデルよりも一貫して信頼しており、PIMモデルが過剰に一般化されていると批判することはほとんどなかったが、一部の参加者は一部のデータを欠いていると指摘した。
  • ユーザースタディのヒートマップでは、PIMモデルの方がSMモデルよりも「良い」(信頼できる)構造がより多く強調されており、実際のデータに含まれる根拠と強い一致を示していることがわかった。
  • 産業界の実務家が最も好むトレードオフとして、PIMが適合度、正確性、単純さのパラメータのパレートフロンティアに位置していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。