Skip to main content
QUICK REVIEW

[論文レビュー] All That Glitters Is Not Gold: Towards Process Discovery Techniques with Guarantees

Jan Martijn E. M. van der Werf, Artem Polyvyanyy|arXiv (Cornell University)|Dec 23, 2020
Business Process Modeling and Analysis参考文献 28被引用数 8
ひとこと要約

本論文は、プロセス発見アルゴリズムがより高品質なイベントログからより良いモデルを生成することを保証するフレームワークを提案する。ログ品質の統計的指標とモデル品質の適合性チェックを導入し、現在のアルゴリズムが直感的な関係を保証しないことを特定。入出力品質保証を確立するための4段階の設計プロセスと形式的性質を導入し、プロセス発見技術の成熟度を向上させる。

ABSTRACT

The aim of a process discovery algorithm is to construct from event data a process model that describes the underlying, real-world process well. Intuitively, the better the quality of the event data, the better the quality of the model that is discovered. However, existing process discovery algorithms do not guarantee this relationship. We demonstrate this by using a range of quality measures for both event data and discovered process models. This paper is a call to the community of IS engineers to complement their process discovery algorithms with properties that relate qualities of their inputs to those of their outputs. To this end, we distinguish four incremental stages for the development of such algorithms, along with concrete guidelines for the formulation of relevant properties and experimental validation. We will also use these stages to reflect on the state of the art, which shows the need to move forward in our thinking about algorithmic process discovery.

研究の動機と目的

  • 既存のプロセス発見アルゴリズムにおいて、入力イベントログ品質と出力プロセスモデル品質を結びつける形式的保証が欠如している問題に対処すること。
  • 真のプロセスが分かっている・分かっていないの両状況においても、標準化され、統計的に根拠のあるイベントログ品質の評価指標を提案すること。
  • 入力ログ品質と出力モデル品質の間の形式的関係を、定義可能なアルゴリズム的性質を通じて確立すること。
  • 検証可能な品質保証を備えたプロセス発見アルゴリズムの開発を支援する4段階のフレームワークを導入すること。
  • プロセスマイニングコミュニティが、限られたデータセットでのベンチマークを超えた形式的・統計的検証を採用するよう促すこと。

提案手法

  • 真のプロセスが不明な状況においても、代表的なサンプルを用いてログの特徴を推定する統計的サンプリング技術を提案し、イベントログ品質を推定する。
  • 標準的な適合性チェック測定指標(精度、再現率、適合性)を用いて、発見されたプロセスモデルの品質を評価する指標として採用する。
  • 入力ログ品質と出力モデル品質を結びつける性質(例:単調性、統計的関連性)を形式的に定義するフレームワークを導入する。
  • 品質保証と検証要件の厳密さが段階的に向上する4段階の、プロセス発見アルゴリズムの設計ステージを提示する。
  • 実験的評価を通じて、既存のアルゴリズムがより高品質なログから低品質なログよりも悪いモデルを生成する可能性があることを示し、直感的な期待に反する事実を明らかにする。
  • 既に確立された適合性測定指標の性質(例:[28, 29, 24] より)を用いて、モデル品質評価の一貫性と正しさを保証する。

実験結果

リサーチクエスチョン

  • RQ1既存のプロセス発見アルゴリズムが、より高品質な入力ログがより高品質な出力モデルをもたらすという直感的な期待に反する事例を示すことができるか?
  • RQ2真のプロセスが不明な状況においても、イベントログ品質を客観的に評価できる統計的指標は何か?
  • RQ3より高品質な入力ログがより高品質な出力モデルをもたらすように保証するための形式的性質をどのように定義できるか?
  • RQ4検証可能な品質保証を備えたプロセス発見アルゴリズムの開発をガイドする体系的フレームワークは何か?
  • RQ5モデル品質の向上を目的とせず、アルゴリズム評価のための入力ログ品質の評価に、サンプリング技術をどのように応用できるか?

主な発見

  • 実証的証拠により、既存のプロセス発見アルゴリズムが、より低品質なイベントログからより良いモデルを生成する可能性があることが示された。これは、期待される入出力品質関係を破る。
  • 提案された統計的サンプリングアプローチにより、真のプロセスにアクセスできない状況でも、代表的サンプルと推測統計を用いてイベントログ品質を信頼性高く推定できる。
  • 精度、再現率、適合性といった適合性チェック測定指標は、既に確立された望ましい性質を満たしており、形式的フレームワーク内でのモデル品質評価に適している。
  • 4段階のアルゴリズム設計フレームワークは、基本的な正しさから、入出力品質依存関係の形式的統計的検証まで、段階的に品質保証を強化する。
  • 現在のベンチマークは不十分である。なぜなら、アルゴリズムがより良いログからより良いモデルを生成するかどうかを検証していないため、評価手法に深刻な欠落がある。
  • 次世代のプロセス発見アルゴリズムには、単調性やログ品質とモデル品質の統計的関連性といった形式的保証が不可欠であると本論文で確立された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。