Skip to main content
QUICK REVIEW

[論文レビュー] SUMMARIZED: Efficient Framework for Analyzing Multidimensional Process Traces under Edit-distance Constraint

Phuong Anh Nguyen, Vatche Ishakian|arXiv (Cornell University)|May 2, 2019
Semantic Web and Ontologies参考文献 35被引用数 4
ひとこと要約

本稿では、編集距離制約下での多次元プロセストレースの分析を効率的に行うためのフレームワーク「Summarized」を提案する。高次元データをユーザーが制御可能な要約空間に変換することで、類似度計算の高速化を実現するとともに、クラスタリング品質を維持または向上させる。実証的に、要約データから導出されたプロセスモデルにおいて、適合度が高く、構造的複雑度が低い結果が得られた。

ABSTRACT

Domains such as scientific workflows and business processes exhibit data models with complex relationships between objects. This relationship is typically represented as sequences, where each data item is annotated with multi-dimensional attributes. There is a need to analyze this data for operational insights. For example, in business processes, users are interested in clustering process traces into smaller subsets to discover less complex process models. This requires expensive computation of similarity metrics between sequence-based data. Related work on dimension reduction and embedding methods do not take into account the multi-dimensional attributes of data, and do not address the interpretability of data in the embedding space (i.e., by favoring vector-based representation). In this work, we introduce Summarized, a framework for efficient analysis on sequence-based multi-dimensional data using intuitive and user-controlled summarizations. We introduce summarization schemes that provide tunable trade-offs between the quality and efficiency of analysis tasks and derive an error model for summary-based similarity under an edit-distance constraint. Evaluations using real-world datasets show the effectives of our framework.

研究の動機と目的

  • 編集距離メトリクス下での多次元プロセストレースにおける類似度計算の高コストを軽減すること。
  • ビジネスプロセスや科学的ワークフローなど、複雑な多属性シーケンスの効率的分析を可能にすること。
  • 分析の効率性と結果の品質のバランスを取れる、直感的で制御可能な要約スキームをユーザーに提供すること。
  • 要約空間における編集距離の理論的誤差モデルを構築し、類似度ベースの分析の信頼性を保証すること。
  • 実世界のデータセットを用いた評価を通じて、クラスタリングおよびプロセスモデル発見における有効性を示すこと。

提案手法

  • 計算コストを削減するため、元の多次元プロセストレースを低次元の要約空間に変換すること。
  • 属性ベースの要約を導入し、ユーザーが特定の属性(例:TrackedBy, Sector)を選択して要約グループを定義すること。
  • クラスタリング(例:LDA)を用いて類似したアクティビティをトピックにグループ化するトピックベースの要約を提案し、パラメータkを調整することで解像度を制御可能にすること。
  • 与えられた制約下で、要約空間における編集距離が元の空間からの逸脱を制限する誤差モデルを導出すること。
  • 要約データに対して編集距離を用いた階層的クラスタリングを適用し、コンactかつ解釈可能なプロセスモデルを発見すること。
  • ProMプラグインを用いて、Petriネットモデルにおける適合度と構造的複雑度分析により結果を検証すること。

実験結果

リサーチクエスチョン

  • RQ1多次元プロセストレースの要約は、編集距離ベースの分析における計算コストを顕著に低減しつつ、結果の品質を維持または向上させることができるか?
  • RQ2属性ベースとトピックベースの異なる要約スキームは、トレースクラスタリングおよびプロセスモデル発見における正確性と効率性にどのように影響を与えるか?
  • RQ3元の空間における編集距離と要約空間における編集距離の理論的関係は何か?また、その関係は境界をもつことができるか?
  • RQ4トピックベースの要約は、類似度ベースの分析における効率性と有効性のトレードオフをどの程度調整可能に提供できるか?
  • RQ5要約は類似度計算におけるノイズを低減させ、適合度と複雑度の観点から、より良いクラスタリング結果をもたらすか?

主な発見

  • k=20のトピックベース要約は、意味的により明確な属性ベース要約とほぼ同等の適合度と構造的複雑度を達成している。
  • 特にTrackedBy属性を用いた属性ベース要約は、一貫して最高の適合度と最小の構造的複雑度を示しており、意味的保存性が優れていることを示している。
  • ランダム要約は適合度と複雑度の両面で最悪の結果を示しており、効果的なクラスタリングに意味的構造が不可欠であることを確認している。
  • フレームワークは処理時間を顕著に短縮しており、図9では、リソグラフィ、BPIC、Bankの各データセットにおいて、トピック要約がランダム要約を上回る性能を示している。
  • Summarizedは類似度計算におけるノイズをフィルタリングすることで、元のデータを用いた分析と比較して、より正確でコンactなプロセスモデルを生成する。
  • 理論的誤差モデルは、要約空間における信頼性のある類似度推定の基盤を提供し、下流の分析タスクにおける信頼性を担保している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。