Skip to main content
QUICK REVIEW

[論文レビュー] A framework for mining process models from emails logs

Diana Jlailaty, Daniela Grigori|arXiv (Cornell University)|Sep 20, 2016
Personal Information Management and User Behavior参考文献 6被引用数 6
ひとこと要約

本稿では、階層的クラスタリングおよびk-meansクラスタリングを用いて、手動ラベルなしでメールログからビジネスプロセスモデルを自動的に発見する非教師ありフレームワークを提案する。この手法により、プロセスインスタンスとアクティビティを自動的に特定し、アクティビティ名を付与する半自動ラベリングを可能にし、将来的なアクティビティ認識に最小限の人的入力を要する。本アプローチは、会議の調整および研究助成金の申請という2つの実世界のメールデータセットから、プロセスモデルを効果的に抽出できた。

ABSTRACT

Due to its wide use in personal, but most importantly, professional contexts, email represents a valuable source of information that can be harvested for understanding, reengineering and repurposing undocumented business processes of companies and institutions. Towards this aim, a few researchers investigated the problem of extracting process oriented information from email logs in order to take benefit of the many available process mining techniques and tools. In this paper we go further in this direction, by proposing a new method for mining process models from email logs that leverage unsupervised machine learning techniques with little human involvement. Moreover, our method allows to semi-automatically label emails with activity names, that can be used for activity recognition in new incoming emails. A use case demonstrates the usefulness of the proposed solution using a modest in size, yet real-world, dataset containing emails that belong to two different process models.

研究の動機と目的

  • 手動ラベル付き学習データを必要とせずに、未文書化されたビジネスプロセスを生のメールログから発見する課題に対処すること。
  • 非教師あり学習を用いて、メールをプロセスインスタンスに自動的にクラスタリングし、関連するアクティビティを特定する手法を開発すること。
  • 将来的なアクティビティ認識およびタスク推薦システムへの応用を想定し、アクティビティ名を付与する半自動ラベリングを可能にすること。
  • 2つの異なるビジネスプロセスを含む、実世界の中小規模のメールデータセットを対象として、本フレームワークの実用性と有効性を実証すること。
  • 生のメールメッセージを解析可能なプロセスモデルに変換することで、非構造的メール通信におけるプロセスマイニングの能力を拡張すること。

提案手法

  • 段階的なクラスタリングパイプラインを適用:まずトピックごとにメールをグループ化するための階層的クラスタリングを実施し、次にプロセスインスタンスを特定するためのk-meansクラスタリングを実行する。
  • 得られたクラスタを基に、メールにアクティビティ名を半自動でラベル付ける手順を実施し、手動アノテーションへの依存を低減する。
  • 事前にプロセスモデルやアクティビティの数を知らなくてもよいように、特に階層的クラスタリングおよびk-meansクラスタリングを用いた非教師あり機械学習手法を活用する。
  • クラスタリングおよびプロセスマイニングに備えるために、生のメールをクリーニングおよび正規化する処理を実施する。
  • 将来のメール受信時にアクティビティ認識を支援するため、ラベル付きクラスタをトレーニングデータセットとして活用する。
  • 既存のプロセスマイニングツールと互換性のあるイベントログにメールログをマッピングすることで、プロセスマイニング技術を統合する。

実験結果

リサーチクエスチョン

  • RQ1手動ラベル付き学習データを必要とせずに、未構造的かつ生のメールログからビジネスプロセスモデルをどのように発見できるか?
  • RQ2非教師ありクラスタリング手法は、どの程度メールを意味のあるプロセスインスタンスおよびアクティビティに適切にグループ化できるか?
  • RQ3クラスタベースのラベリングを用いることで、メールにアクティビティ名を半自動で付与し、人的アノテーション作業をどの程度削減できるか?
  • RQ41つのメールログに複数の並列して進行するプロセスモデルが存在する場合、本フレームワークはそれらをどの程度正確に特定・区別できるか?
  • RQ5得られたラベル付きデータは、将来的なアクティビティ認識およびメール作業環境におけるインテリジェントなタスク推薦にどの程度寄与できるか?

主な発見

  • 本フレームワークは、人的介入を最小限に抑え、実世界のメールデータセットから2つの明確なプロセスモデル(会議の調整および国際会議の助成金申請)を発見した。
  • 事前にプロセストピックの数を知らなくても、階層的クラスタリングがトピックレベルのグループ化を効果的に特定した。
  • k-meansクラスタリングにより、各トピッククラスタ内での個々のプロセスインスタンスを特定でき、インスタンスレベルのプロセスマイニングを可能にした。
  • クラスタベースのラベリング手法により、メールにアクティビティ名を付与する実用的で半自動的な方法が得られ、手動アノテーションの必要性が著しく低下した。
  • 本フレームワークは、中小規模の実世界データセットにおいて実用性を示した。また、既存のプロセスマイニングツールとの統合可能性も示した。
  • EmailAnalyzerなどの先行研究と比較して、本手法はメール件名にタスク名を明示的に含める必要がない点で優れている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。