Skip to main content
QUICK REVIEW

[논문 리뷰] Prototype Selection Based on Clustering and Conformance Metrics for Model Discovery

Mohammadreza Fani Sani, Mathilde Boltenhagen|arXiv (Cornell University)|2019. 11. 29.
Business Process Modeling and Analysis참고 문헌 27인용 수 4
한 줄 요약

이 논문은 프로세스 트레이스의 군집화를 사용하여 이벤트 로그에서 대표적인 인스턴스(프로토타입)를 식별하고, 이를 바탕으로 더 높은 품질의 프로세스 모델을 발견하는 점진적 프로토타입 선택 방법을 제안한다. 제어 흐름 거리와 적합도 메트릭을 기반으로 반복적으로 프로토타입을 선택함으로써, 모델 복잡도를 증가시키지 않고도 품질 기준 간의 균형과 적합도를 향상시킨다. 이는 실제 이벤트 로그에서 최신 기술의 샘플링 및 필터링 기법들을 능가한다.

ABSTRACT

Process discovery aims at automatically creating process models on the basis of event data captured during the execution of business processes. Process discovery algorithms tend to use all of the event data to discover a process model. This attitude sometimes leads to discover imprecise and/or complex process models that may conceal important information of processes. To address this problem, several techniques, from data filtering to model repair, have been elaborated in the literature. In this paper, we introduce a new incremental prototype selection algorithm based on clustering of process instances. The method aims to iteratively compute a unique process model with a different set of selected prototypes, i.e., representative of whole event data and stops when conformance metrics decrease. The proposed method has been implemented in both the ProM and the RapidProM platforms. We applied the proposed method on several real event data with state-of-the-art, process discovery algorithms. Results show that using the proposed method leads to improve the general quality of discovered process models.

연구 동기 및 목표

  • 대규모이고 이질적인 이벤트 로그에서 과도하게 복잡하고 정확도가 떨어지는 프로세스 모델을 발견하는 데 도전하는 데 목적을 두며.
  • 프로세스 발견에서 적합도, 정밀도, 일반화 및 단순성 간의 균형을 향상시키는 데 목적을 두며.
  • 모델 품질을 향상시키기 위해 지능적인 프로토타입 선택을 통해 발견 알고리즘에 종속되지 않는 방법을 개발하는 데 목적을 두며.
  • 데이터 변동성을 줄이고 모델 복잡도를 낮추면서도 이벤트 로그의 핵심 행동 패턴을 유지하는 데 목적을 두며.
  • 적합도 검사 기반으로 프로토타입 선택을 이끄는 안정적이고 점진적인 접근을 제공하는 데 목적을 두며.

제안 방법

  • 제어 흐름 거리를 사용하여 프로세스 트레이스를 군집화하여 유사한 행동 패턴을 그룹화한다.
  • 각 군집의 중심점(센트로이드)을 대표 프로토타입으로 선택함으로써 다양한 프로세스 변형을 포함한다.
  • 표준 발견 알고리즘을 사용하여 선택된 프로토타입에서 프로세스 모델을 발견한다.
  • 적합도 메트릭을 기반으로 반복적으로 이탈 트레이스에서 새로운 프로토타입을 추가함으로써 적합도와 정밀도 간의 균형을 유지한다.
  • Fβ-측정치를 사용하여 점진적 선택 과정을 평가하고 이导向하며, 종합적인 품질이 높은 모델을 우선시한다.
  • 이 방법은 ProM과 RapidProM에 구현되어 기존의 프로세스 마이닝 도구 및 워크플로우와의 통합을 가능하게 한다.

실험 결과

연구 질문

  • RQ1군집화 기반 프로토타입 선택이 전체 이벤트 로그를 사용할 때와 비교해 발견된 프로세스 모델의 품질을 어떻게 향상시키는가?
  • RQ2점진적 프로토타입 선택은 프로세스 모델의 적합도, 정밀도, 일반화 및 단순성 간의 균형을 어느 정도 향상시키는가?
  • RQ3프로토타입 선택 과정에서 적합도 메트릭을 사용할 경우 모델 품질과 안정성은 어떻게 영향을 받는가?
  • RQ4제안된 방법은 실제 세계의 이벤트 로그에서 기존의 샘플링 및 필터링 기법들을 능가할 수 있는가?
  • RQ5프로토타입 선택 전략(빈도 대비 군집화)이 모델의 적합도와 정밀도에 미치는 영향은 무엇인가?

주요 결과

  • Sepsis 로그에서 군집화를 통해 선택된 프로토타입 5%만으로도 35%의 트레이스 커버리지를 달성하여 최소한의 데이터로 높은 적합도를 확보했다.
  • 10개 이상의 프로토타입을 사용할 경우, 빈도 기반 선택보다 군집화 기반 프로토타입 선택이 더 높은 모델 적합도를 달성했으며, 특히 변형 다양성이 높은 로그에서 두드러졌다.
  • 주로 빈번한 변형이 지배하는 Road 로그에서는 빈도 기반 선택이 더 적은 프로토타입으로 더 높은 커버리지를 달성했지만, 복잡하고 이질적인 로그에서는 군집화 기반 선택이 우월했다.
  • 여러 개의 실제 이벤트 로그와 발견 알고리즘에서 Fβ-측정치로 측정한 바, 적합도와 정밀도 간의 균형이 향상되었다.
  • 전체 로그 기반 모델보다 복잡도가 낮고 이해하기 쉬운 모델이 발견되었으며, 관찰된 행동 패턴과의 적합도는 유지되었다.
  • 모델 품질 메트릭에서 파arameter 설정에 관계없이 안정성을 보였고, 항상 최신 기술의 샘플링 및 필터링 방법들을 능가했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.