[논문 리뷰] Business Process Deviance Mining: Review and Evaluation
이 논문은 비즈니스 프로세스 위반 탐지에 대한 시퀀스 분류 기법의 비교 평가를 제안하며, 빈도 패턴 및 특징적 패턴 마이닝과 같은 특징 추출 방법과 간단한 활동 수와의 비교에 초점을 맞춘다. 복합 패턴(예: MRA, IP 기반)이 규칙 집합의 흥미로움 정도를 크게 향상시키고, 특히 변동성이 낮은 프로세스에서 기본 수와 비교해 정확도 면에서 뛰어나지만, 높은 변동성의 워크플로우에서는 성능 향상이 점점 줄어든다.
Business process deviance refers to the phenomenon whereby a subset of the executions of a business process deviate, in a negative or positive way, with respect to its expected or desirable outcomes. Deviant executions of a business process include those that violate compliance rules, or executions that undershoot or exceed performance targets. Deviance mining is concerned with uncovering the reasons for deviant executions by analyzing business process event logs. This article provides a systematic review and comparative evaluation of deviance mining approaches based on a family of data mining techniques known as sequence classification. Using real-life logs from multiple domains, we evaluate a range of feature types and classification methods in terms of their ability to accurately discriminate between normal and deviant executions of a process. We also analyze the interestingness of the rule sets extracted using different methods. We observe that feature sets extracted using pattern mining techniques only slightly outperform simpler feature sets based on counts of individual activity occurrences in a trace.
연구 동기 및 목표
- 비즈니스 프로세스 위반 탐지에 대한 기존 접근법을 시퀀스 분류 기법을 기반으로 체계적으로 검토하고 분류하는 것.
- 실생활 비즈니스 프로세스 이벤트 로그에서 다양한 특징 추출 방법—개별 활동 수, 빈도 패턴, 특징적 패턴—의 성능을 평가하는 것.
- 정규 프로세스 트레이스와 위반 프로세스 트레이스를 구분하는 분류기 구축을 위해 추출된 특징에 표준 분류 알고리즘(예: 의사결정나무)을 적용하는 것.
- 분류 정확도와 탐지된 규칙 집합의 흥미로움 정도를 각각 실용적 유용성의 지표로 삼아, 프로세스 분석가가 활용할 수 있는 통찰력을 제공하는 특징 유형과 분류 방법을 규명하는 것.
- 풍부한 이벤트 속성을 지닌 복잡한 실세계 로그에 적용할 때 현재의 기호적 시퀀스 기반 접근법의 한계를 탐색하는 것.
제안 방법
- 비즈니스 프로세스 위반, 시퀀스 마이닝, 특징적 패턴과 관련된 키워드를 사용해 구글 색색을 활용한 체계적 문헌 리뷰.
- 특징 추출 기법 평가: (1) 개별 활동 빈도 수, (2) 빈도 패턴 마이닝(FP-Growth), (3) 특징적 패턴 마이닝(MRA, IP, IA, 집합 기반), (4) 피셔 스코어를 이용한 특징 선택.
- 추출된 특징에 표준 분류 알고리즘(예: 의사결정나무)을 적용하여 정상 대 위반 프로세스 트레이스를 구분하는 분류기 구축.
- 다양한 분야(예: 헬스케어, 보험, MySQL)의 실생활 이벤트 로그를 다수 활용하여 균형 잡힌 및 균형이 깨진 위반 조건 하에서의 성능 테스트.
- 다양한 흥미로움 측정 기준을 사용해 규칙 집합의 품질 평가: 피어슨 상관계수, 유일의 Q, 피아테츠키-샤피로, 정보 이득, 규칙 길이, %일반화.
- AUC 및 정확도 지표를 사용해 분류기의 예측 성능을 벤치마킹하여 다양한 데이터셋 간의 성능 평가.
실험 결과
연구 질문
- RQ1활동 수, 빈도 패턴, 특징적 패턴 등 다양한 특징 추출 기법이 위반 탐지의 분류 정확도 측면에서 어떻게 상호 비교되는가?
- RQ2복합 패턴(예: MRA, IP 기반)이 간단한 특징에 비해 탐지된 규칙의 흥미로움 정도를 얼마나 향상시키는가?
- RQ3저변동성 프로세스와 고변동성 프로세스 간에 패턴 기반 특징의 성능에 유의미한 차이가 있는가?
- RQ4특징 선택을 위한 피셔 스코어의 포함 여부가 최종 분류기의 품질과 예측 능력에 어떤 영향을 미치는가?
- RQ5다양한 특징 유형과 데이터셋 간에 분류 정확도와 규칙 집합의 해석 가능성(흥미로움 정도) 사이의 상충 관계는 어떠한가?
주요 결과
- 패턴 마이닝 기법(예: MRA, IP 기반)은 모든 데이터셋에서 단순 활동 빈도 수에 비해 규칙 집합의 흥미로움 정도 면에서 끊임없이 뛰어나며, 특히 피어슨 상관계수 및 피아테츠키-샤피로 측정 기준에서 두각을 나타낸다.
- MRA 기반 및 IP 기반 규칙 집합은 병원1 및 보험1 데이터셋을 포함한 다수의 데이터셋에서 가장 높은 누적 흥미로움 점수를 기록했으며, 짧은 규칙 길이와 높은 %일반화를 보였다.
- 저변동성 프로세스에서는 패턴 기반 특징이 분류 정확도를 크게 향상시켰다(일부 케이스에서 AUC가 최대 90%까지 상승), 반면 고변동성 프로세스에서는 정확도 향상이 거의 없었고, 최대 약 80% AUC에 머물렀다.
- IA 기반 규칙 집합은 대부분의 흥미로움 측정 기준에서 열등했지만, Yule의 Q와 정보 이득에서는 더 큰 규칙 집합에서 성능 향상을 보였으며, 이는 실용적 유용성이 제한적임을 시사한다.
- 집합 기반 및 IP 기반 특징은 %일반화와 규칙 길이에서 약간의 향상을 보였으며, 이는 규칙 표현의 일반화 능력 향상과 더 짧은 표현을 의미한다.
- 본 연구는 근본적인 한계를 드러내며, 현재의 기호적 시퀀스 기반 방법은 풍부한 이벤트 페이로드(예: 타임스탬프, 속성-값 쌍)를 무시한다는 점을 밝히며, 향후 연구에서는 복잡한 기호적 시퀀스 마이닝의 필요성을 제기한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.