Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Named Entity Tagger using Domain-Specific Dictionary

Jingbo Shang, Liyuan Liu|arXiv (Cornell University)|2018. 09. 10.
Topic Modeling인용 수 9
한 줄 요약

이 논문은 인간의 레이블링 데이터 없이 도메인 전용 사전만을 사용하는 새로운 신경망 모델 AutoNER를 제안한다. 노이즈가 많은 레이블에도 불구하고 엔티티 스팬 경계를 안정적으로 모델링하기 위해 Tie or Break 태깅 체계를 도입함으로써, AutoNER는 기존 방법들을 능가하며 세 가지 벤치마크 데이터셋에서 감독 학습 기반 기준과 경쟁 가능한 성능을 달성한다.

ABSTRACT

Recent advances in deep neural models allow us to build reliable named entity recognition (NER) systems without handcrafting features. However, such methods require large amounts of manually-labeled training data. There have been efforts on replacing human annotations with distant supervision (in conjunction with external dictionaries), but the generated noisy labels pose significant challenges on learning effective neural models. Here we propose two neural models to suit noisy distant supervision from the dictionary. First, under the traditional sequence labeling framework, we propose a revised fuzzy CRF layer to handle tokens with multiple possible labels. After identifying the nature of noisy labels in distant supervision, we go beyond the traditional framework and propose a novel, more effective neural model AutoNER with a new Tie or Break scheme. In addition, we discuss how to refine distant supervision for better NER performance. Extensive experiments on three benchmark datasets demonstrate that AutoNER achieves the best performance when only using dictionaries with no additional human effort, and delivers competitive results with state-of-the-art supervised benchmarks.

연구 동기 및 목표

  • 인간 레이블링이 비용이 많이 들고 시간이 오래 걸리는 저자원 도메인에서 정확한 NER 시스템을 구축하는 데 도전한다.
  • 사전 커버리지가 불완전하고 엔티티 스팬이 모호한 이유로 노이즈가 많은 레이블을 생성하는 원격 지도 학습의 한계를 극복한다.
  • 추가적인 인간 레이블링 데이터가 필요 없이 불완전한 사전 기반 레이블을 효과적으로 활용할 수 있는 신경망 모델을 개발한다.
  • 고품질의 사전 외 어휘를 추출하고 '알 수 없는' 유형으로 임시 엔티티로 간주함으로써 원격 지도 학습을 개선함으로써 NER 성능을 향상시킨다.
  • 레이블 노이즈에 강건하고 엔티티 언급의 구조를 더 잘 활용할 수 있도록 새로운 태깅 체계와 신경망 아키텍처를 설계한다.

제안 방법

  • 중복된 사전 매칭으로 인한 모호성을 다루기 위해 토큰이 다중 레이블을 가질 수 있도록 표준 CRF 레이어를 확장한 Fuzzy-LSTM-CRF 모델을 제안한다.
  • 연속된 토큰들이 같은 엔티티 언급의 일부인지(연결됨, tied) 아닌지(분리됨, broken)를 예측하는 새로운 Tie or Break 태깅 체계를 도입하여 경계 수준의 노이즈에 대한 강건성을 향상시킨다.
  • AutoNER에서 두 단계 신경망 아키텍처를 설계한다: 먼저 인접 토큰 간의 연결 여부를 탐지해 후보 스팬을 생성하고, 그 다음 각 스팬의 유형을 분류한다.
  • 고품질의 사전 외 어휘를 코퍼스에서 추출하여 '알 수 없는' 유형으로 임시 엔티티로 레이블링함으로써 원격 지도 학습을 개선한다. 이는 거짓 음성 오류를 줄이는 데 기여한다.
  • 확장된 사전(추가로 추출된 어휘 포함)을 사용해 정확한 문자열 매칭을 수행하여 초깃표시를 생성하고, 총 매칭 토큰 수를 최대화함으로써 충돌을 해결한다.
  • 교차 엔트로피 손실과 역전파를 사용해 모델을 엔드 투 엔드로 훈련하며, Tie or Break 체계가 노이즈가 많은 지도 학습 환경에서 더 나은 일반화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1도메인 전용 사전만을 사용하고 인간 레이블링 데이터가 전혀 없는 조건에서 신경망 모델이 강력한 NER 성능을 달성할 수 있는가?
  • RQ2기존의 시퀀스 레이블링 방식에 비해 Tie or Break 태깅 체계는 원격 지도 학습에서 발생하는 노이즈 레이블에 대해 얼마나 강건한가?
  • RQ3원격 지도 학습 하에서 고품질의 사전 외 어휘를 추출하는 것이 NER 성능 향상에 얼마나 기여하는가?
  • RQ4인간 레이블링에 의존하는 고비용 감독 기반 기준과 비교해 AutoNER는 어떻게 성능을 내는가?
  • RQ5사전 확장과 어휘 추출을 통한 원격 지도 학습의 개선이 종합적인 NER 성능에 미치는 영향은 무엇인가?

주요 결과

  • AutoNER는 인간 레이블링 데이터 없이 사전 기반 원격 지도 학습만으로도 BC5CDR, NCBI, BioCreative 세 벤치마크 데이터셋에서 가장 높은 F1 스코어를 기록한다.
  • Fuzzy-LSTM-CRF 모델은 강력한 베이스라인으로 기능하지만, AutoNER는 새로운 Tie or Break 체계의 효과를 입증하며 그를 크게 능가한다.
  • 추출한 사전 외 어휘를 '알 수 없는' 유형 엔티티로 통합함으로써 거짓 음성 오류가 감소하고 전체 성능이 향상됨을 아블레이션 연구를 통해 검증하였다.
  • AutoNER의 성능은 대규모 인간 레이블링 데이터에 의존하는 최신 감독 기반 모델과 경쟁 가능함을 입증하여 사전 기반 학습의 실현 가능성을 입증한다.
  • 아블레이션 연구는 Tie or Break 체계와 개선된 원격 지도 학습(어휘 추출을 통한)이 최적의 성능을 달성하는 데 있어 필수적임을 확인한다.
  • 의료(BC5CDR, NCBI) 및 일반 도메인(laptop 리뷰) 데이터셋에서 일관된 성능 향상을 보이며, 다양한 도메인으로의 일반화 능력이 뛰어나다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.