Skip to main content
QUICK REVIEW

[논문 리뷰] Scale Up Event Extraction Learning via Automatic Training Data Generation

Ying Zeng, Yansong Feng|arXiv (Cornell University)|2017. 12. 11.
Topic Modeling참고 문헌 21인용 수 3
한 줄 요약

이 논문은 구조화된 지식 기반(예: Freebase, 위키백과 테이블)을 활용하여 이벤트 추출을 위한 고품질 훈련 데이터를 자동으로 생성하는 원거리 지도 학습 방식을 제안한다. 수동 주석이 필요 없이 키 어휘를 사용함으로써, 이 방법은 수천 개에서 수십만 개의 인스턴스로 훈련 데이터를 확장하여 신경망 모델이 후처리 추론을 통해 다중 유형 이벤트 탐지에서 최신 기술 수준의 성능을 달성한다. 인간의 노력이 최소한이 된다.

ABSTRACT

The task of event extraction has long been investigated in a supervised learning paradigm, which is bound by the number and the quality of the training instances. Existing training data must be manually generated through a combination of expert domain knowledge and extensive human involvement. However, due to drastic efforts required in annotating text, the resultant datasets are usually small, which severally affects the quality of the learned model, making it hard to generalize. Our work develops an automatic approach for generating training data for event extraction. Our approach allows us to scale up event extraction training instances from thousands to hundreds of thousands, and it does this at a much lower cost than a manual approach. We achieve this by employing distant supervision to automatically create event annotations from unlabelled text using existing structured knowledge bases or tables.We then develop a neural network model with post inference to transfer the knowledge extracted from structured knowledge bases to automatically annotate typed events with corresponding arguments in text.We evaluate our approach by using the knowledge extracted from Freebase to label texts from Wikipedia articles. Experimental results show that our approach can generate a large number of high quality training instances. We show that this large volume of training data not only leads to a better event extractor, but also allows us to detect multiple typed events.

연구 동기 및 목표

  • 감독형 이벤트 추출에서 작은 수의 수동 주석 훈련 데이터셋이 초래하는 성능 저하 문제를 해결하기 위해.
  • 수동 주석된 이벤트 트리거가 필요 없이 구조화된 지식 기반에서 유도된 키 어휘에 의존하여 트리거가 명시적으로 필요 없도록 하기 위해.
  • 원거리 지도 학습을 통해 수천 개에서 수십만 개의 인스턴스로 이벤트 추출을 위한 훈련 데이터를 확장하기 위해.
  • 대규모 자동 생성 훈련 데이터를 활용하여 효과적인 다중 유형 이벤트 탐지 구현을 위해.
  • 명시적인 트리거 식별이 필요 없는 후처리 추론 기반 신경망 모델 개발을 위해.

제안 방법

  • 이벤트 유형을 정의하는 데 사용되는 핵심 어휘를 식별하기 위해 구조화된 지식 기반(예: Freebase, 위키백과 테이블)을 활용한다.
  • 이러한 핵심 어휘를 이벤트 유형의 대체 지표로 삼아 비정형 텍스트(예: 위키백과 기사)를 자동으로 레이블링하기 위해 원거리 지도 학습을 적용한다.
  • 이벤트 유형을 가장 잘 특징짓는 가장 정보성 높은 핵심 어휘를 식별하기 위해 히우리스틱을 설계한다.
  • 명시적인 이벤트 트리거에 의존하지 않고 이벤트 추출을 수행하는 신경망 아키텍처(BLSTM-CRF-ILP)를 개발한다.
  • 예측의 일관성을 보장하고 정밀도를 향상시키기 위해 후처리 추론 단계에서 선형 정수 프로그래밍(ILP)을 사용한다.
  • 이름 있는 실체 및 시간적/구문적 단서를 기반으로 텍스트 스트링을 구조화된 테이블 항목과 매칭하여 훈련 데이터를 생성한다.

실험 결과

연구 질문

  • RQ1구조화된 지식 기반에서 유도된 핵심 어휘를 사용하여 명시적인 트리거 주석 없이도 이벤트 유형을 유추할 수 있는가?
  • RQ2구조화된 테이블을 기반으로 한 원거리 지도 학습이 이벤트 추출을 위한 고품질 훈련 데이터를 얼마나 효과적으로 생성할 수 있는가?
  • RQ3자동 생성된 데이터로 훈련된 신경망 모델이 다중 이벤트 유형을 효과적으로 탐지할 수 있는가?
  • RQ4제안된 방법의 성능은 이벤트 유형 분류 및 어휘 탐지의 F1 스코어 측면에서 수동 주석 데이터셋과 비교해 볼 때 어떻게 되는가?
  • RQ5표 기반 지도 학습만을 사용하여 비즈니스 인수, 올림픽 우승, 수상과 같은 다양한 이벤트 유형에 일반화할 수 있는가?

주요 결과

  • 제안된 방법은 널리 사용되는 ACE 챌린지 데이터셋보다 14배 더 큰 훈련 데이터셋을 수년이 아닌 수 시간 내에 생성하였다.
  • 수동 주석 데이터와 비교해도 유사한 F1 스코어를 기록하였으며, 인수 이벤트의 경우 87.0%, 올림픽 이벤트의 경우 77.2%, 수상 이벤트의 경우 95.0%의 F1 스코어를 기록하였다.
  • TBWiki 데이터셋에서 핵심 어휘 탐지(KAD)의 경우 72.0% F1, 모든 어휘 탐지(AAD)의 경우 69.6% F1을 기록하여 강력한 일반화 능력을 입증하였다.
  • 이 방법은 이전 방법이 거의 지원하지 못하는 효과적인 다중 유형 이벤트 탐지 기능을 실현하였다.
  • 트리거 대신 핵심 어휘를 사용함으로써, 'bankrupt' 또는 'filed' 동사가 없는 문장과 같이 명시적인 이벤트 트리거가 없는 경우에도 이벤트를 탐지할 수 있었다.
  • ILP 후처리 추론 통합으로 어휘 일관성과 전체 추출 품질이 크게 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.