Skip to main content
QUICK REVIEW

[논문 리뷰] KnowDis: Knowledge Enhanced Data Augmentation for Event Causality Detection via Distant Supervision

Xinyu Zuo, Yubo Chen|arXiv (Cornell University)|2020. 10. 21.
Topic Modeling참고 문헌 27인용 수 6
한 줄 요약

KnowDis는 어휘적 및 원인 공통지식을 활용하여 고품질의 훈련 데이터를 자동으로 생성하는 지식 강화된 원거리 지도 학습 프레임워크를 제안한다. Lexicon-Enhanced Annotator, Common Sense Filter 및 재라벨링/냉각 전략을 통합함으로써 KnowDis는 원거리 레이블이 부여된 데이터를 사용하여 EventStoryLine 및 Causal-TimeBank 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Modern models of event causality detection (ECD) are mainly based on supervised learning from small hand-labeled corpora. However, hand-labeled training data is expensive to produce, low coverage of causal expressions and limited in size, which makes supervised methods hard to detect causal relations between events. To solve this data lacking problem, we investigate a data augmentation framework for ECD, dubbed as Knowledge Enhanced Distant Data Augmentation (KnowDis). Experimental results on two benchmark datasets EventStoryLine corpus and Causal-TimeBank show that 1) KnowDis can augment available training data assisted with the lexical and causal commonsense knowledge for ECD via distant supervision, and 2) our method outperforms previous methods by a large margin assisted with automatically labeled training data.

연구 동기 및 목표

  • 이벤트 원인관계 탐지(ECD)에서 수동으로 레이블이 부여된 훈련 데이터의 부족으로 인해 모델 성능이 제한되는 문제를 해결한다.
  • 기존 ECD 데이터셋의 낮은 커버리지와 작은 규모 문제를 해결하기 위해 고품질의 훈련 예제를 자동으로 생성한다.
  • 어휘적 및 원인 공통지식을 통합하여 원거리 레이블이 부여된 데이터의 품질을 향상시켜 노이즈를 줄이고 원인적 의미 표현을 강화한다.
  • 노이즈가 많은 원거리 지도 학습 데이터를 효과적으로 활용하기 위해 필터링, 재라벨링, 냉각 전략을 통합한 견고한 데이터 증강 파이프라인을 개발한다.
  • 지식 강화된 자동으로 레이블이 부여된 훈련 데이터를 사용하여 ECD 기준 데이터셋에서 최신 기술 수준의 성능을 달성한다.

제안 방법

  • Lexicon-Enhanced Annotator(LexiAnno)는 동의어, 하위관계어, 동사 클래스 유사도를 활용하여 WordNet과 VerbNet에서 원인적 이벤트 쌍을 추출하여 훈련 신호를 확장한다.
  • Common Sense Filter(CommonFilter)는 원인 공통지식을 활용하여 원거리 레이블이 부여된 문장을 정제함으로써 원인적 표현의 의미적 타당성을 향상시킨다.
  • 노이즈 감소와 원거리 레이블이 부여된 데이터에서의 모델 일반화 능력 향상을 위해 재라벨링 및 냉각 전략을 적용한다.
  • 최대 간격 손실을 사용하는 transE 기반 임베딩 유사도를 활용하여 높은 확률의 원인적 이벤트 쌍을 순위 매기고 선택하여 원거리 레이블링을 수행한다.
  • NYT 코퍼스에 원거리 지도 학습을 적용하였으며, 레이블링된 집합과 추출된 집합에 포함된 이벤트 쌍을 포함하는 무작위로 선택된 문장 중 5%를 훈련 데이터로 레이블링한다.
  • 최종 모델은 수동 레이블링된 데이터와 지식 증강된 원거리 훈련 데이터의 조합으로 훈련되며, 재라벨링 및 학습률 냉각을 통한 반복적 정밀 조정이 이루어진다.

실험 결과

연구 질문

  • RQ1WordNet과 VerbNet의 어휘 지식을 효과적으로 활용하여 ECD의 데이터 증강을 위한 고확률 원인적 이벤트 쌍을 다량으로 생성할 수 있는가?
  • RQ2원인 공통지식은 원거리 레이블이 부여된 문장의 품질, 특히 의미적 타당성 측면에서 어떻게 향상시킬 수 있는가?
  • RQ3재라벨링 및 냉각 전략이 원거리 지도 학습 기반 ECD 데이터에서 노이즈를 얼마나 줄이고 모델 성능을 향상시키는가?
  • RQ4지식 강화된 원거리 지도 학습을 통합할 경우, 순수 지도 학습 또는 지식 증강이 없는 약한 지도 학습 방법에 비해 ECD 기준 데이터셋에서 유의미한 성능 향상이 이루어지는가?
  • RQ5지식 통합의 효과를 극대화하면서 노이즈 축적을 최소화하기 위해 원거리 훈련 데이터의 최적 비율은 얼마인가?

주요 결과

  • KnowDis는 EventStoryLine 코퍼스에서 기존 최고 성능 기법 대비 4.4점 향상된 49.7의 새로운 최신 기술 수준 F1 스코어를 달성한다.
  • LexiAnno를 통한 추출된 원인적 이벤트 쌍의 포함으로 인해 레이블이 부여된 쌍만을 사용한 경우 대비 F1 스코어가 4.4점 향상되었으며, 지식 확장의 가치를 입증한다.
  • Common Sense Filter를 제거할 경우 F1 스코어가 1.6점 감소하여 원인 공통지식이 어휘적 연결어보다 원거리 레이블이 부여된 데이터 정제에 더 효과적임을 보여준다.
  • 재라벨링 및 냉각 전략 각각이 성능 향상에 기여하며, 재라벨링은 노이즈를 감소시키고 냉각 전략은 노이즈가 많은 데이터에서 모델 수렴을 향상시킨다.
  • 원인 그룹($D_n^c$)의 원거리 레이블이 부여된 데이터 중 50%를 유지할 경우 최적의 성능을 달성하며, 이보다 더 높은 유지율은 추가 지식의 이점보다 노이즈 증가로 인해 성능 저하를 초래한다.
  • 원인 지식이 없는 EDA 기반 데이터 증강 기법보다 유의미하게 뛰어난 성능을 보이며, 데이터 증강 과정에서 원인 특화 지식 통합의 필요성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.