[논문 리뷰] Striking a new balance in accuracy and simplicity with the Probabilistic Inductive Miner
확률적 인도적 마이너(Probabilistic Inductive Miner, PIM)는 트레이스 빈도에 기반한 확률적 추론을 사용하여 XOR 및 AND 게이트웨이를 가진 블록 구조 모델을 선택함으로써 모델 정확도와 단순성의 균형을 이루는 새로운 프로세스 발굴 알고리즘을 제안한다. PIM은 최신 기술 대비 더 높은 정밀도와 낮은 복잡도를 달성하였으며, 명확성과 신뢰성 덕분에 산업 분석가들 사이에서 경험적으로 더 선호된다.
Numerous process discovery techniques exist for generating process models that describe recorded executions of business processes. The models are meant to generalize executions into human-understandable modeling patterns, notably parallelism, and enable rigorous analysis of process deviations. However, well-defined models with parallelism returned by existing techniques are often too complex or generalize the recorded behavior too strongly to be trusted in a practical business context. We bridge this gap by introducing the Probabilistic Inductive Miner (PIM) based on the Inductive Miner framework. PIM compares in each step the most probable operators and structures based on frequency information in the data, which results in block-structured models with significantly higher accuracy. All design choices in PIM are based on business context requirements obtained through a user study with industrial process mining experts. PIM is evaluated quantitatively and in an novel kind of empirical study comparing users' trust in discovered model structures. The evaluations show that PIM strikes a unique trade-off between model accuracy and model complexity, that is conclusively preferred by users over all state-of-the-art process discovery methods.
연구 동기 및 목표
- 산업적 프로세스 마이닝 맥락에서 모델 적합도, 정밀도, 단순성 간 선호되는 트레이드오프를 규명하는 것.
- 기존 프로세스 발굴 기법이 과도하게 일반화(낮은 정밀도)되거나 너무 복잡한 모델을 생성함(낮은 단순성)으로 인해 발생하는 격차를 해소하는 것.
- 신뢰성, 명확성, 근거 기반 모델링을 충족하는 산업 요구사항을 충족하는 프로세스 발굴 알고리즘을 개발하는 것.
- 기존 기법 대비 높은 정밀도와 낮은 복잡도를 가진 모델이 실무자들 사이에서 선호되는지 평가하는 것.
제안 방법
- PIM은 블록 구조 모델을 보장하고 XOR 및 AND 게이트웨이만 허용함으로써 구조적 단순성 요구사항을 충족시키기 위해 인도적 마이너 프레임워크를 확장한다.
- 알고리즘은 각 재귀 단계에서 가장 가능성이 높은 프로세스 연산자(예: 병렬성, 루프)를 트레이스 빈도 기반의 확률적 추론을 통해 결정한다.
- 필터링 메커니즘이 도입되어 가장 빈번한 k개의 활동만 고려하고, 희귀한 행동은 확률 임계값을 적용하여 제외한다.
- PIM은 IMf(빈도 필터링)와 IMc(확률적 모델링)의 원리를 통합하여 정밀도와 복잡도의 균형을 이룬다.
- 모델 복잡도는 구성 가능한 파라미터를 통해 제어되며, 분석가들이 세부 정보와 단순성 사이에서 트레이드오프를 설정할 수 있다.
- 경험적 평가는 11명의 전문가를 대상으로 한 사용자 연구를 통해 수행되었으며, 모델의 신뢰성과 선호도를 평가하였고, 참가자들은 모델의 명확성과 근거 기반 구조에 대해 평가했다.
실험 결과
연구 질문
- RQ1산업적 프로세스 마이닝 전문가들이 프로세스 모델 발굴에 대해 선호하는 적합도, 정밀도, 단순성의 균형은 무엇인가?
- RQ2인도적 마이너 프레임워크의 확률적 확장이 데이터에 충분한 증거를 유지하면서도 높은 정밀도와 낮은 복잡도를 가진 모델을 생성할 수 있는가?
- RQ3PIM로 발굴된 모델은 IMf, SM 및 기타 최신 기술 대비 더 높은 사용자 신뢰도와 선호도를 달성하는가?
- RQ4사용자들이 PIM 모델이 데이터에 충분한 증거를 지녔다고 인식하는 정도는 어느 정도이며, 실제 행동 패턴을 반영한 구조에 대해 신뢰를 느끼는가?
주요 결과
- PIM는 IMf보다 유의미하게 높은 정밀도를 달성하였고, SM과 유사한 F-스코어를 기록하였지만, 구조적 복잡도가 크게 낮은 모델을 생성하였다.
- 경험적 평가에서 참가자들은 실제 데이터 세트 3개 중 2개(청구서 및 BPIC17 cp)에서 PIM을 가장 좋은 모델로 선호하였고, RTFMP에서는 SM을 선호하였다.
- 모델 선호도에 대한 서면 정당화 중 58.8%가 단순성, 명확성 또는 가독성 덕분에 PIM을 선택한 이유로 언급하였다.
- 참가자들은 항상 SM이나 IMf보다 PIM 모델을 더 신뢰하였으며, PIM 모델이 과도하게 일반화되었다고 비판하는 경우가 거의 없었고, 일부는 데이터의 일부를 놓쳤다는 점을 언급하기는 하였다.
- 사용자 연구에서의 히트맵 분석 결과, PIM 모델은 SM 모델보다 더 많은 '좋은'(신뢰할 수 있는) 구조가 강조되어 있어 데이터의 인식된 증거와의 더 높은 일치를 보였다.
- 산업 전문가들이 선호하는 최적의 트레이드오프로 확인된 PIM의 프로세스 마이닝의 정확도, 정밀도, 단순성의 파레토 프론트 상 유일한 위치가 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.