Skip to main content
QUICK REVIEW

[논문 리뷰] Log Skeletons: A Classification Approach to Process Discovery

H. M. W. Verbeek, Renata Medeiros de Carvalho|arXiv (Cornell University)|2018. 06. 21.
Business Process Modeling and Analysis인용 수 4
한 줄 요약

이 논문은 분류 기반 접근법을 통해 프로세스 발굴을 위한 규칙 기반, 제약 조건 기반 모델인 로그 스켈레톤(log skeletons)을 소개한다. 이는 선언형 모델인 Declare와 유사한 구조를 지닌다. 이론적으로는 이벤트 로그에서 로그 스켈레톤을 자동으로 생성하는 알고리즘을 사용하여, 2017년 프로세스 발굴 경연 대회에서 200개 중 194개의 트레이스를 올바르게 분류했으며, 이는 기존 최고 수준의 발굴 알고리즘인 Inductive Miner가 달성한 147개보다 뛰어난 성능이다.

ABSTRACT

To test the effectiveness of process discovery algorithms, a Process Discovery Contest (PDC) has been set up. This PDC uses a classification approach to measure this effectiveness: The better the discovered model can classify whether or not a new trace conforms to the event log, the better the discovery algorithm is supposed to be. Unfortunately, even the state-of-the-art fully-automated discovery algorithms score poorly on this classification. Even the best of these algorithms, the Inductive Miner, scored only 147 correct classified traces out of 200 traces on the PDC of 2017. This paper introduces the rule-based log skeleton model, which is closely related to the Declare constraint model, together with a way to classify traces using this model. This classification using log skeletons is shown to score better on the PDC of 2017 than state-of-the-art discovery algorithms: 194 out of 200. As a result, one can argue that the fully-automated algorithm to construct (or: discover) a log skeleton from an event log outperforms existing state-of-the-art fully-automated discovery algorithms.

연구 동기 및 목표

  • 모델의 품질을 트레이스 분류 정확도로 측정하는 분류 문제로 프로세스 발굴을 재정의함으로써 프로세스 발굴을 향상시키는 것.
  • 기존의 완전 자동화된 발굴 알고리즘이 이벤트 로그의 트레이스를 정확히 분류하는 데에 한계를 지닌다는 문제를 해결하는 것.
  • 이벤트 로그 내의 구조적 제약 조건을 포괄하는 규칙 기반 모델인 로그 스켈레톤을 자동으로 생성하는 새로운 방법을 제안하는 것.
  • 로그 스켈레톤을 기반으로 한 분류 기반 접근법이 기존의 전통적 발굴 알고리즘보다 성능 면에서 뛰어나다는 것을 입증하는 것.
  • ProM 6와 같은 프로세스 마이닝 도구에 실용적으로 구현할 수 있도록 하며, 향후 노이즈 필터링 및 모델 변환 기능의 통합을 고려하는 것.

제안 방법

  • 항목 간의 구조적 관계, 즉 항상 이전, 항상 이후, 등가 관계를 기반으로 이벤트 로그에서 로그 스켈레톤을 구성하며, 표준 Declare 제약 조건을 초월한 확장 기능을 포함한다.
  • 트레이스가 로그 스켈레톤에 의해 포함되는 경우(필터링된 로그 또는 트레이스 버전 포함) 양성(합리적)으로 분류되는 규칙 기반 분류 메커니즘을 사용한다.
  • 분류 과정에서 트레이스 필터링을 적용한다: 트레이스가 로그 스켈레톤에 대해 조건을 충족하면, 로그나 트레이스에서 일부 활동을 선택적으로 제거한 후에도 여전히 합리적이라 간주한다.
  • 빈도 및 동시 발생 분석을 통해 이벤트 로그에서 제약 조건(예: 순서, 연속, 공존성 등)을 자동으로 도출한다.
  • ProM 6에 이벤트 로그 뷰어로 구현하여 발견된 로그 스켈레톤을 상호작용적으로 검토할 수 있도록 한다.
  • 경연 대회에서 완벽한 분류 성능을 달성하기 위해 수동 전처리기(예: 활동 필터링, 분할)를 사용하였으며, 향후 작업으로는 이러한 전처리 단계의 자동화를 목표로 한다.

실험 결과

연구 질문

  • RQ1분류 기반 접근법이 기존의 전통적 발굴 알고리즘보다 트레이스 분류 정확도 면에서 뛰어나게 성능을 발휘할 수 있는가?
  • RQ2항상 이전, 항상 이후, 등가성 등의 구조적 제약 조건을 기반으로 한 규칙 기반 로그 스켈레톤 모델은 실제 이벤트 로그의 트레이스를 얼마나 효과적으로 분류할 수 있는가?
  • RQ3분류 과정에서 트레이스 필터링을 포함할 경우, 모델의 강건성과 정확도는 어느 정도 향상되는가?
  • RQ4왜 로그 스켈레톤 접근법은 프로시저 모델(예: 페트리 네트워크, BPMN)보다 분류 작업에서 뛰어난 성능을 보이며, 특히 프로세스 발굴 경연 대회 맥락에서 그러한 우월성이 나타나는가?
  • RQ5로그 스켈레톤 모델은 이벤트 로그의 노이즈를 탐지하고 처리할 수 있도록 확장될 수 있는가? 이러한 개선 사항이 분류 성능에 어떤 영향을 미칠 것인가?

주요 결과

  • 로그 스켈레톤 기반 분류 방법은 2017년 프로세스 발굴 경연 대회에서 200개 중 194개의 트레이스를 정확히 분류하여, 기존 최고 수준의 발굴 알고리즘을 크게 앞서 갔다.
  • 최고 수준의 완전 자동화된 발굴 알고리즘인 Inductive Miner는 동일한 테스트 세트에서 단지 147개의 정확한 분류를 기록했다.
  • 이 방법의 성공은 복잡한 구조적 제약 조건(비-Declare 관계 포함)을 모델링하면서도, 트레이스 필터링 조건 하에서도 분류 정확도를 유지할 수 있는 능력 덕분이다.
  • 수동 전처리기(예: 활동 필터링 및 분할)를 통해 경연 대회에서 완벽한 분류(200/200)를 달성했으며, 이는 이러한 단계의 자동화가 완전 자동화된 버전의 성능 향상에 기여할 수 있음을 시사한다.
  • 로그 스켈레톤 모델은 노이즈에 민감한 편이지만, 활동이 누락되거나 잘못된 활동이 포함된 경우에도 항상 이전 또는 등가성 관계와 같은 핵심 관계가 깨지지 않는 한 강건성을 유지한다.
  • 결과는 PDC가 프로시저 모델에 대한 편향이 있을 수 있음을 시사하며, 이는 로그 스켈레톤이 프로시저 모델을 시험하기 위해 설계된 로그에 더 적합할 수 있음을 의미하며, 향후 경연 대회의 새로운 기준이 될 잠재성을 지닌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.