Skip to main content
QUICK REVIEW

[논문 리뷰] Template-Based Named Entity Recognition Using BART

Leyang Cui, Yu Wu|arXiv (Cornell University)|2021. 06. 03.
Topic Modeling참고 문헌 29인용 수 11
한 줄 요약

이 논문은 BART를 사용한 템플릿 기반 소수의 샘플을 위한 명명된 실체 인식 방법을 제안하며, NER를 시퀀스에서 시퀀스로의 생성 작업으로 간주하여, 채우기 전략이 적용된 템플릿(예: '방갈로르는 위치 실체입니다')를 통해 후보 스팬을 점수화한다. 이 방법은 자원이 적은 도메인에서 미세조정된 BERT와 메트릭 기반 방법보다 뚜렷이 뛰어난 성능을 보이며, CoNLL03에서 92.55 F1을 기록하고, MIT Movie, MIT Restaurant, ATIS에서 각각 10.88~15.34 F1 향상률을 달성한다.

ABSTRACT

There is a recent interest in investigating few-shot NER, where the low-resource target domain has different label sets compared with a resource-rich source domain. Existing methods use a similarity-based metric. However, they cannot make full use of knowledge transfer in NER model parameters. To address the issue, we propose a template-based method for NER, treating NER as a language model ranking problem in a sequence-to-sequence framework, where original sentences and statement templates filled by candidate named entity span are regarded as the source sequence and the target sequence, respectively. For inference, the model is required to classify each candidate span based on the corresponding template scores. Our experiments demonstrate that the proposed method achieves 92.55% F1 score on the CoNLL03 (rich-resource task), and significantly better than fine-tuning BERT 10.88%, 15.34%, and 11.73% F1 score on the MIT Movie, the MIT Restaurant, and the ATIS (low-resource task), respectively.

연구 동기 및 목표

  • 자원이 풍부한 소스 도메인과 다른 레이블 세트를 가진 자원이 적은 도메인에서 소수의 샘플을 위한 명명된 실체 인식의 과제를 해결한다.
  • 기존의 유사도 기반 메트릭 방법의 한계를 극복한다. 이러한 방법들은 모델 파라미터를 업데이트하지 못하고 텍스트 패턴 유사도에 의존한다.
  • 출력 레이어를 재학습하거나 일관된 레이블 세트가 필요 없이 새로운 실체 유형에 대해 제로샷 및 소수의 샘플 적응을 가능하게 한다.
  • BART와 같은 사전 훈련된 모델의 생성 능력을 활용하여 소스 도메인에서 타겟 도메인으로 지식 전이를 향상시킨다.
  • 출력 레이어를 수정하지 않거나 다시 학습하지 않고도 새로운 실체 유형을 점진적으로 추가할 수 있도록 지속적 학습을 지원한다.

제안 방법

  • NER를 시퀀스에서 시퀀스로의 생성 문제로 간주한다: 입력은 원본 문장이며, 타겟은 후보 스팬과 실체 유형으로 채워진 템플릿이다(예: '방갈로르는 위치 실체입니다').
  • 각 스팬에 대해 올바른 실체 진술을 생성할 수 있도록 소스 도메인 데이터를 템플릿을 사용해 BART를 미세조정한다.
  • 추론 과정에서 입력 문장 내 모든 후보 스팬을 나열하고, 해당 스팬에 대해 모델이 해당 템플릿을 생성할 가능성에 따라 점수를 매긴다.
  • 비실체에 대해서는 '<span>은 명명된 실체가 아닙니다'와 같은 템플릿을 사용하여 스팬의 이진 분류를 가능하게 한다.
  • 사전 훈련된 언어 모델의 일반화 능력을 활용하여 글쓰기 스타일과 레이블 세트가 다른 도메인 간 지식 전이를 가능하게 한다.
  • 출력 레이어를 수정하지 않거나 다시 학습하지 않고도 새로운 도메인에 대해 미세조정함으로써 지속적 학습을 지원한다.

실험 결과

연구 질문

  • RQ1BART와 같은 생성형 사전 훈련된 모델은 출력 레이어를 재학습하지 않고도 새로운 실체 유형을 포함한 소수의 샘플 NER에 효과적으로 적용될 수 있는가?
  • RQ2템플릿 기반 NER는 자원이 적은 도메인 간 전이 설정에서 기존의 순차적 레이블링 및 메트릭 기반 소수의 샘플 방법과 비교해 어떻게 성능을 냈는가?
  • RQ3이 방법은 글쓰기 스타일과 레이블 분포가 다른 도메인 간에 얼마나 잘 일반화되는가?
  • RQ4이 방법은 소수의 샘플 설정에서 저빈도 및 중간빈도 실체 유형의 성능을 어떻게 향상시키는가?
  • RQ5모델은 기존의 파라미터를 재학습하지 않고도 새로운 실체 유형을 점진적으로 통합함으로써 치명적인 잊힘 없이 지속적 학습을 지원할 수 있는가?

주요 결과

  • 제안된 방법은 CoNLL03 벤치마크에서 92.55 F1을 기록하여 자원이 풍부한 NER에서 뛰어난 성능을 보였다.
  • 자원이 적은 도메인에서, 모델은 MIT Movie, MIT Restaurant, ATIS에서 각각 BERT의 F1 점수를 10.88, 15.34, 11.73 포인트 향상시켰다.
  • 중간빈도 및 저빈도 실체 유형에서 뛰어난 강건성을 보였으며, MIT Restaurant, MIT Movie, ATIS에서 BERT보다 각각 6.6, 6.9, 5.4의 F1 향상률을 기록했다.
  • 지속적 학습 실험에서 CoNLL03 모델을 MIT Movie와 MIT Restaurant에 대해 미세조정했을 때 CoNLL03 성능에 약간의 하락만이 발생하여 강력한 도메인 일반화 능력을 보였다.
  • t-SNE 시각화 결과, 템플릿 기반 BART의 출력 임베딩은 BERT의 데이터셋 군집화된 임베딩과 대비해 더 도메인 독립적이고 흩어진 분포를 보이며, 더 나은 도메인 간 일반화 능력을 나타낸다.
  • 오류 분석 결과, 레이블 의미가 소스 도메인 레이블(예: 'PERSON')과 거리가 먼 경우(예: 'SONG') 성능 저하가 발생하지만, 이 경우에도 여전히 BERT를 능가하는 성능을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.