Skip to main content
QUICK REVIEW

[논문 리뷰] May I Take Your Order? On the Interplay Between Time and Order in Process Mining

Wil M. P. van der Aalst, Luis F. R. Santos|arXiv (Cornell University)|2021. 07. 08.
Business Process Modeling and Analysis참고 문헌 13인용 수 7
한 줄 요약

이 논문은 이벤트 로그의 비신뢰성 있는 타임스탬프와 부적절한 시간 순서를 다루기 위해 굵은 시간 집계와 사용자 정의 가능한 티브레이커를 조합하여 국소 순서를 생성하는 전처리 프레임워크를 제안한다. ProM에 통합된 PartialOrderVisualizer를 도입하여 이러한 국소 순서를 탐색할 수 있게 하여, 부정확한 타임스탬프로 인한 오류를 줄이고 표준 기법과의 호환성을 위한 k-순서화를 지원함으로써 더 정확한 프로세스 마이닝을 가능하게 한다.

ABSTRACT

Process mining starts from event data. The ordering of events is vital for the discovery of process models. However, the timestamps of events may be unreliable or imprecise. To further complicate matters, also causally unrelated events may be ordered in time. The fact that one event is followed by another does not imply that the former causes the latter. This paper explores the relationship between time and order. Moreover, it describes an approach to preprocess event data having timestamp-related problems. This approach avoids using accidental or unreliable orders and timestamps, creates partial orders to capture uncertainty, and allows for exploiting domain knowledge to (re)order events. Optionally, the approach also generates interleavings to be able to use existing process mining techniques that cannot handle partially ordered event data. The approach has been implemented using ProM and can be applied to any event log.

연구 동기 및 목표

  • 프로세스 마이닝에서 과도한 시간 순서 오류를 유발하는 비신뢰성 있거나 부정확한 타임스탬프 문제를 해결한다.
  • 실제 시스템에서 지연되거나 굵은 시간 간격으로 기록되는 이벤트로 인한 잘못된 시간 순서를 완화한다.
  • 강제적인 전체 순서 대신 국소 순서를 사용하여 이벤트 순서의 불확실성을 체계적으로 표현하는 방법을 제공한다.
  • k-순서화를 통해 부분적으로 순서가 지정된 데이터에 표준 프로세스 마이닝 기법을 적용할 수 있도록 한다.
  • 도메인 전문가가 인과적 또는 논리적 제약 조건을 티브레이커를 통해 이벤트 순서에 통합할 수 있도록 지원한다.

제안 방법

  • 타임스탬프를 세분화(예: 초에서 시간 또는 일 단위로)하여 임의의 순서 오류를 줄이기 위해 타임스탬프 집계기(ta)를 사용한다.
  • 세분화된 타임스탬프와 추가적인 인과적 또는 도메인 특화 제약 조건을 기반으로 이벤트 간 국소 순서 ≺o를 정의한다.
  • 동일한 시간 간격을 공유하는 다수의 이벤트가 있을 경우를 해결하기 위해 티브레이커 ≺tb를 도입하여 결정론적인 국소 순서 생성을 가능하게 한다.
  • ProM에 통합된 PartialOrderVisualizer를 구현하여 다양한 시간 해상도에서 이벤트 로그를 상호작용적으로 탐색하고 국소 순서 변형을 시각화할 수 있도록 한다.
  • 표준 프로세스 마이닝 도구가 반드시 전체 순서를 요구하므로, 부분적으로 순서가 지정된 이벤트 로그의 k-순서화를 생성한다.
  • 실제 로그(예: P2P, 코로나19 치료, 도로 과태료)에 이 방법을 적용하여 확장성과 통찰력 생성 능력을 입증한다.

실험 결과

연구 질문

  • RQ1비신뢰성 있거나 부정확한 타임스탬프를 가진 이벤트 로그를 어떻게 전처리하여 프로세스 모델 발견 시 오류를 줄일 수 있는가?
  • RQ2타임스탬프 오류가 존재하는 상황에서 시간 간격의 세분화가 프로세스 마이닝 결과의 정확도를 얼마나 향상시키는가?
  • RQ3국소 순서가 의미 있는 프로세스 의미를 유지하면서도 이벤트 순서의 불확실성을 효과적으로 표현할 수 있는가?
  • RQ4어떻게 도메인 지식을 이벤트 순서에 통합하여 프로세스 모델의 품질을 향상시킬 수 있는가?
  • RQ5부분적으로 순서가 지정된 로그에 적용했을 때 k-순서화가 트레이스 변형 수와 모델 충실도에 어떤 영향을 미치는가?

주요 결과

  • 타임스탬프 집계기를 사용한 시간 간격의 세분화는 특히 헬스케어 및 행정 로그에서 부정확한 타임스탬프로 인한 잘못된 순서를 크게 줄인다.
  • 시간 간격을 세분화할수록 국소 순서 변형의 수가 증가할 수 있지만, 모든 이벤트가 동일한 시간 간격으로 매핑될 경우 그 수가 최소화된다.
  • PartialOrderVisualizer를 통해 다양한 시간 해상도에서 이벤트 로그를 상호작용적으로 탐색할 수 있으며, 활동이 동일한 시간대(예: 시간 또는 주 단위)에 자주 발생하는 패턴을 드러낸다.
  • P2P 프로세스 로그(2,654건의 케이스)의 경우, 시간 간격을 1시간으로 설정하면 국소 순서 변형이 710개 발생했고, 주 단위 간격으로 설정하면 순서가 지정되지 않은 이벤트 수가 증가하여 k=10일 때 8,864개의 트레이스 변형이 발생했다.
  • 이 방법은 효율적으로 확장되며, 높은 해상도의 시간 추상화를 사용해도 560만 건 이상의 이벤트를 포함한 큰 도로 과태료 로그를 약 10초 내에 처리하여 실용적 적용 가능성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.