[논문 리뷰] Detecting and Explaining Drifts in Yearly Grant Applications
이 논문은 다변량 비즈니스 프로세스 로그에서 개념 드리프트를 탐지하고 진단하기 위한 모델에 종속되지 않으며 설명 가능한 방법을 제안한다. 확률적 스코링을 통해 분해 가능한 베이지안 네트워크를 활용한다. 수작업 특성 선택 없이 유럽 연합(EU) 보조금 신청 데이터에서 연도 간 드리프트를 식별하고, 특성별 스코어 분해를 통해 근본 원인 분석을 가능하게 하며, 설명 가능한 시각화를 통해 연도 간 규제 변화를 성공적으로 탐지한다.
During the lifetime of a Business Process changes can be made to the workflow, the required resources, required documents, . . . . Different traces from the same Business Process within a single log file can thus differ substantially due to these changes. We propose a method that is able to detect concept drift in multivariate log files with a dozen attributes. We test our approach on the BPI Challenge 2018 data con- sisting of applications for EU direct payment from farmers in Germany where we use it to detect Concept Drift. In contrast to other methods our algorithm does not require the manual selection of the features used to detect drift. Our method first creates a model that captures the re- lations between attributes and between events of different time steps. This model is then used to score every event and trace. These scores can be used to detect outlying cases and concept drift. Thanks to the decomposability of the score we are able to perform detailed root-cause analysis.
연구 동기 및 목표
- 수작업 특성 선택이 필요 없이 다변량 비즈니스 프로세스 로그에서 개념 드리프트를 탐지하기 위해.
- 이상치 스코어를 특성 수준 기여도로 분해함으로써 드리프트의 근본 원인 분석을 가능하게 하기 위해.
- 드리프트 및 이심 패턴을 직관적인 시각화를 통해 전문가 및 비전문가 사용자 모두가 이해하고 진단할 수 있도록 지원하기 위해.
- 실제로 변화하는 프로세스 데이터인 BPI 챌린지 2018의 데이터를 대상으로 방법을 평가하기 위해.
- 프로세스 행동의 차이가 연도 간 드리프트 때문인지, 또는 부서 간 차이 때문인지 조사하기 위해.
제안 방법
- 학습 데이터에서 베이지안 네트워크 모델을 구축하여 특성 간의 의존성과 시간적 이벤트 패턴을 포착한다.
- 특성 값, 조건부 확률 및 기능적 의존성에 기반해 각 이벤트 및 트레이스에 복합 스코어를 할당한다.
- 개별 특성의 기여도를 고립시키기 위해 스코어 분해를 사용하여 세밀한 이심 분석을 가능하게 한다.
- 트레이스 스코어 및 드리프트 플롯을 적용하여 로그 내 변화점(Change Points)을 탐지하고, 시각적 군집화를 통해 구분된 프로세스 상태를 식별한다.
- 시간 단위로 나누어 예상치와 관측된 특성 값 간의 비교를 위해 특성 밀도 플롯을 활용하여 이심 특성을 강조한다.
- 모델 스코어를 연도 간 비교하여 드리프트 탐지를 검증하고, 예를 들어 문서 유형, 서브프로세스 등 특성 분포의 이동을 식별한다.
실험 결과
연구 질문
- RQ1비즈니스 프로세스 로그에서 수작업 특성 공학에 의존하지 않고 개념 드리프트를 어떻게 탐지할 수 있는가?
- RQ2BPI 챌린지 2018 데이터셋에서 연속된 해 간 프로세스 행동의 관측된 차이의 원인은 무엇인가?
- RQ3모델의 설명 가능한 스코링 메커니즘이 탐지된 드리프트의 특정 특성 원인을 식별할 수 있는가?
- RQ4부서 간 프로세스 실행에 눈에 띄는 차이가 있으며, 이는 드리프트와 관련이 있는가?
- RQ5시각적 도구는 비전문가 사용자가 프로세스 드리프트를 이해하고 진단하는 데 어떻게 기여하는가?
주요 결과
- 이 방법은 BPI 챌린지 2018 데이터셋에서 연도 간 규제 변화에 해당하는 드리프트를 성공적으로 탐지했으며, 드리프트 포인트가 알려진 연도 경계와 일치했다.
- 특성 밀도 플롯을 통해 문서 유형과 서브프로세스의 변화가 연간 드리프트의 주요 원인임을 밝혀냈다.
- 면적(area)과 number_parcels가 모두 0인 트레이스들이 이질적(outliers)으로 식별되었으며, 이들의 스코어는 기대값에서 크게 벗어났다.
- 모델의 분해 가능한 스코링 메커니즘은 전체 로그 재처리 없이도 특정 특성(예: area)으로의 이심을 정밀하게 국소화할 수 있었다.
- 표준 ID 기반 특성 변동 외에는 부서 간에 유의미한 차이가 없었으며, 이는 부서 간 프로세스 실행이 일관되었음을 시사한다.
- 특성 수준의 기여도를 고립함으로써 효과적인 근본 원인 분석이 가능했으며, 이는 설명 가능한 스코링이 드리프트 탐지에 있어 가치가 있음을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.