[논문 리뷰] Beyond Rule-based Named Entity Recognition and Relation Extraction for Process Model Generation from Natural Language Text
이 논문은 자연어에서 자동으로 비즈니스 프로세스 모델을 생성하기 위한 데이터 기반, 엔드 투 엔드 파이프라인을 제안한다. 규칙 기반 방법을 대체하기 위해 기울기 부스팅 관계 추출과 사전 학습된 공명 해결 기법을 사용한다. PET 데이터셋에 엔티티 정체성 주석을 추가하여 기계 학습 모델이 규칙 기반 접근 방식과 비교해도 성능이 유사하거나 뛰어나며, 특히 개선된 공명 해결 기법을 통합할 경우 더욱 우수한 성능을 보임을 입증한다.
Process-aware information systems offer extensive advantages to companies, facilitating planning, operations, and optimization of day-to-day business activities. However, the time-consuming but required step of designing formal business process models often hampers the potential of these systems. To overcome this challenge, automated generation of business process models from natural language text has emerged as a promising approach to expedite this step. Generally two crucial subtasks have to be solved: extracting process-relevant information from natural language and creating the actual model. Approaches towards the first subtask are rule based methods, highly optimized for specific domains, but hard to adapt to related applications. To solve this issue, we present an extension to an existing pipeline, to make it entirely data driven. We demonstrate the competitiveness of our improved pipeline, which not only eliminates the substantial overhead associated with feature engineering and rule definition, but also enables adaptation to different datasets, entity and relation types, and new domains. Additionally, the largest available dataset (PET) for the first subtask, contains no information about linguistic references between mentions of entities in the process description. Yet, the resolution of these mentions into a single visual element is essential for high quality process models. We propose an extension to the PET dataset that incorporates information about linguistic references and a corresponding method for resolving them. Finally, we provide a detailed analysis of the inherent challenges in the dataset at hand.
연구 동기 및 목표
- 명시적 엔티티 인식(NER) 및 관계 추출(RE)에서 규칙 기반 접근 방식의 한계를 해결하기 위해, 특히 다양한 도메인 간 적용이 어려운 수작업이 많고 유지보수가 어려운 점을 해결한다.
- 동일한 프로세스 요소(예: 'a claim'과 'it') 간 언어적 참조를 해결하여 데이터 및 액터 흐름의 정확성을 확보함으로써 프로세스 모델 생성 품질을 향상시킨다.
- PET과 같은 작은 데이터셋에서도 기계 학습 모델이 경쟁적인 성능을 달성할 수 있음을 입증하여 수작업 규칙 및 특징 공학에 대한 의존도를 줄인다.
- PET 데이터셋에 핵심 참조 주석을 추가하여 프로세스 정보 추출에서 엔티티 정체성 해결 평가가 가능하도록 확장한다.
- 언어적 다양성과 관계의 인자 간 거리가 관계 추출 성능에 미치는 영향을 조사하여, 비즈니스 프로세스 모델링을 위한 저자원 NLP의 주요 과제를 규명한다.
제안 방법
- PET 데이터셋으로 훈련된 기울기 부스팅 기계 학습 접근 방식(BoostRelEx)을 사용해 규칙 기반 NER 및 RE를 대체함으로써 일반화 능력을 향상시키고 수작업 규칙 설계를 줄인다.
- 도메인 내 데이터로 미세조정된 사전 학습된 신경망 공명 해결 모델을 도입하여 'it', 'the claim'과 같은 언급을 단일 엔티티로 해결함으로써 프로세스 모델 내 정확한 데이터 흐름을 확보한다.
- 동일한 엔티티의 언급 간 언어적 참조를 주석 처리하여 PET 데이터셋을 개선함으로써 프로세스 모델링 맥락에서의 공명 해결 평가가 가능하도록 한다.
- 언급 탐지, 관계 추출, 공명 해결을 동시에 학습하는 전략을 사용하여 파이프라인 단계 간 오류 전파를 완화한다.
- 관계 인자의 거리(토큰 수)와 예측 정확도 간 상관관계를 분석하기 위해 로지스틱 회귀를 적용하여 성능 저하 요인을 규명한다.
- micro-F1 및 신뢰구간을 사용하여 제안된 방법을 규칙 기반 베이스라인(RuleRelEx) 및 최첨단 NLP 모델(예: Jerex)과 비교 평가한다.

실험 결과
연구 질문
- RQ1PET과 같은 작은 데이터셋에서 기계 학습 모델이 NER 및 관계 추출에서 규칙 기반 방법과 유사하거나 뛰어난 정밀도와 재현율을 달성할 수 있는가?
- RQ2사전 학습된 공명 해결 모델이 언어적 참조를 해결하기 위한 기초로 간단한 단어 매칭보다 우수한 성능을 보일 수 있는가?
- RQ3동일한 작은 데이터셋(PET)에서 훈련된 딥러닝 방법이 규칙 기반 시스템과 비교해 성능이 유사하거나 떨어지지 않는가?
- RQ4언어적 다양성과 관계 인자 간 거리가 프로세스 모델링 맥락에서 관계 추출 모델의 성능에 어떤 영향을 미치는가?
- RQ5초기 파이프라인 단계(예: NER)에서 발생하는 오류 전파가 최종 프로세스 모델 품질을 얼마나 떨어뜨리는가? 그리고 통합 모델링은 이를 완화할 수 있는가?
주요 결과
- 기울기 부스팅 관계 추출 모델(BoostRelEx)은 대부분의 관계 유형에서 규칙 기반 방법(RuleRelEx)보다 F1 스코어에서 뛰어나며, 특히 'Further Specification' 관계에서 F1이 0.93을 기록한다.
- 장거리 관계에서는 RuleRelEx가 BoostRelEx보다 더 견고한 편이다. 특히 'Same Gateway' 관계의 경우, RuleRelEx는 32토큰 거리까지 정확도를 유지하지만, BoostRelEx는 15토큰을 초과하면 상당히 성능이 떨어진다.
- 로지스틱 회귀 분석 결과, 'Further Specification' 관계의 경우 인자 간 거리와 정확도 사이에 유의미한 상관관계는 없지만, 넓은 신뢰구간은 더 많은 데이터가 있을 경우 민감성이 존재할 수 있음을 시사한다.
- 공명 해결은 필수적이다. 이를 생략할 경우, 두 개의 별개의 'claim' 객체가 생성되어 잘못된 프로세스 의미를 유도한다.
- 오류 전파가 명백하다. 엔티티 언급 탐지나 관계 분류 오류가 후속 모델 생성 단계로 전파되어 악화되며, 이는 통합 모델링의 필요성을 강조한다.
- Jerex(최첨단 NLP 모델)는 데이터 부족으로 인해 PET에서 성능이 떨어지지만, 도메인 특화 미세조정과 더 큰 데이터셋이 제공된다면 향후 적용에 매우 강력한 후보로 남아있다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.