Skip to main content
QUICK REVIEW

[논문 리뷰] Rapid Customization for Event Extraction

Yee Seng Chan, Joshua Fasching|arXiv (Cornell University)|2018. 09. 20.
Topic Modeling참고 문헌 12인용 수 4
한 줄 요약

이 논문은 새로운 이벤트 유형에 대해 10분 이내로 인간의 노력이 10분 미만으로 빠르게 맞춤형 이벤트 추출을 가능하게 하는 최소한의 감독을 사용하는 시스템을 제시한다. 단어 임bedding과 WordNet을 사용해 초기 트리거를 확장하고, 원거리 감독을 적용해 자동으로 레이블을 부여하며, ACE에서 애너테이션된 인자들을 활용해 일반화 가능한 인자 추출기를 훈련시킨다. 이로 인해 인간 간섭을 최소화하면서도 67개의 새로운 이벤트 유형에서 뛰어난 성능을 달성한다.

ABSTRACT

We present a system for rapidly customizing event extraction capability to find new event types and their arguments. The system allows a user to find, expand and filter event triggers for a new event type by exploring an unannotated corpus. The system will then automatically generate mention-level event annotation automatically, and train a Neural Network model for finding the corresponding event. Additionally, the system uses the ACE corpus to train an argument model for extracting Actor, Place, and Time arguments for any event types, including ones not seen in its training data. Experiments show that with less than 10 minutes of human effort per event type, the system achieves good performance for 67 novel event types. The code, documentation, and a demonstration video will be released as open source on github.com.

연구 동기 및 목표

  • 이벤트 추출 시스템을 새로운 이벤트 유형에 확장하기 위해 필요한 인간의 노동을 줄이기 위해.
  • 최소한의 인간 입력과 자동 트리거 확장을 통해 이벤트 추출기를 신속하게 맞춤화할 수 있도록 하기 위해.
  • 기존 ACE 애너테이션을 활용해 새로운 이벤트 유형(포함된 바 없음)에 대해 일반화 가능한 인자 추출 모델을 훈련시키기 위해.
  • 새로운 이벤트 유형을 위한 트리거 선택 및 필터링을 가속화하는 사용자 인터페이스를 개발하기 위해.
  • 67개의 이전에 보지 못한 이벤트 유형에 대해 시스템의 실용적 유용성을 입증하기 위해.

제안 방법

  • 사용자가 새로운 이벤트 유형에 대해 몇 개의 초기 트리거 단어를 제공한다.
  • 시스템은 단어 임베딩(높은 코사인 유사도)과 WordNet(하위종류)를 사용해 이 트리거를 확장한다.
  • 사용자가 확장된 트리거를 검토하여 관련 있는 용어만 유지함으로써 최종 트리거 집합을 구성한다.
  • 비애너테이션 코퍼스에 원거리 감독을 적용해 이벤트 트리거를 위한 자동으로 생성된 훈련 예제를 생성한다.
  • 자동으로 생성된 트리거 예제를 기반으로 컨volutional 신경망(CNN)을 훈련시어 이벤트 탐지 모델을 만든다.
  • 별도의 인자 모델은 ACE에서 애너테이션된 데이터를 기반으로 훈련되어, 어떤 이벤트 유형(포함된 바 없음 포함)에 대해도 액터, 장소, 시간 인자를 추출할 수 있다.

실험 결과

연구 질문

  • RQ1최소한의 인간 애너테이션으로 새로운 이벤트 유형에 대해 이벤트 추출을 신속하게 맞춤화할 수 있는가?
  • RQ2단어 임베딩과 WordNet을 통한 트리거 확장이 커버리지와 정확도 향상에 얼마나 효과적인가?
  • RQ3ACE 데이터에서 훈련된 모델이 ACE 훈련 데이터에 포함되지 않은 이벤트 유형의 인자를 일반화해 추출할 수 있는가?
  • RQ4원거리 감독과 인간의 정제를 조합했을 때 트리거 탐지 성능 향상 정도는 어느 정도인가?
  • RQ5사용자 인터페이스가 맞춤화 파이프라인에서 시간과 노력 절감에 얼마나 기여하는가?

주요 결과

  • 이벤트 유형당 10분 미만의 인간 노력으로 67개의 새로운 이벤트 유형에서 강력한 성능을 달성한다.
  • 원거리 감독에 의한 훈련에 더해 인간의 정제를 거친 트리거 모델(T_h)은 오직 원거리 감독만을 사용한 모델(T_d)보다 성능이 뛰어나, 정제 과정이 일반화 능력을 향상시킨다는 것을 시사한다.
  • ACE 데이터에서 훈련된 인자 모델(A_n)은 골드 트리거를 사용해 동일한 데이터에서 훈련된 모델의 성능에 매우 가까운 전체 F1 스코어를 달성하여, 새로운 이벤트 유형에 대한 강력한 일반화 능력을 입증한다.
  • 100개의 테스트 인자(62개의 액터, 7개의 장소, 10개의 시간)에 대한 인간 검증 예측 결과 정밀도가 0.79를 기록하여, 인자 추출 구성요소의 높은 신뢰성을 확인한다.
  • ACE 훈련 데이터에 포함되지 않은 이벤트 유형에 적용했을 때도 시스템 성능이 유지되며, 이는 인자 모델의 이식 가능성(transferability)을 검증한다.
  • 사용자 인터페이스는 이벤트 유형 간 트리거의 상호 필터링 및 재할당을 가능하게 하여 시간 효율성을 크게 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.