Skip to main content
QUICK REVIEW

[논문 리뷰] NuNER: Entity Recognition Encoder Pre-training via LLM-Annotated Data

Sergei Bogdanov, Alexandre Constantin|arXiv (Cornell University)|2024. 02. 23.
Data Quality and ManagementDecision Sciences인용 수 3
한 줄 요약

이 논문은 C4에서 유래한 LLM에 의해 주석 처리된 2440만 단어의 데이터셋을 RoBERTa로 미세튜닝하여 훈련한 Named Entity Recognition (NER)를 위한 작업 특화 기초 모델인 NuNER를 제안한다. NuNER는 유사한 크기의 모델들 중에서 최신 기술 수준의 소수의 예제 성능을 달성하며, 기초 모델인 RoBERTa와 더불어 NER-BERT와 같은 더 큰 모델보다 뛰어나며, 56배 더 작은 크기임에도 불구하고 GPT-4와 같은 훨씬 큰 LLM들과 경쟁할 수 있다.

ABSTRACT

Large Language Models (LLMs) have shown impressive abilities in data annotation, opening the way for new approaches to solve classic NLP problems. In this paper, we show how to use LLMs to create NuNER, a compact language representation model specialized in the Named Entity Recognition (NER) task. NuNER can be fine-tuned to solve downstream NER problems in a data-efficient way, outperforming similar-sized foundation models in the few-shot regime and competing with much larger LLMs. We find that the size and entity-type diversity of the pre-training dataset are key to achieving good performance. We view NuNER as a member of the broader family of task-specific foundation models, recently unlocked by LLMs.

연구 동기 및 목표

  • 비용이 많이 드는 인간 주석 데이터에 의존도를 줄이고 데이터 효율적인, 작업 특화 기초 모델을 개발하기 위해 Named Entity Recognition (NER)를 위한 모델을 개발한다.
  • LLM에 의해 주석 처리된 데이터가 작고 전용 인코더 모델을 사전 훈련시키는 데 효과적으로 기능할 수 있는지 조사한다.
  • 결과적으로 도출된 모델인 NuNER의 성능을 소수의 예제 및 제로샷 설정에서 대규모 언어 모델과 기존의 NER 전용 모델들과 비교 평가한다.
  • 특히 데이터셋 크기와 엔티티 유형 다양성 등이 작업 특화 기초 모델의 성능에 미치는 영향을 규명한다.

제안 방법

  • GPT-3.5를 사용하여 C4 데이터셋의 일부(2440만 단어)를 20만 개의 고유한 개념에 대해 엔티티 주석을 생성한다.
  • 대조 학습 목표를 사용하여 LLM에 의해 주석 처리된 데이터셋에서 RoBERTa-base 모델을 미세튜닝하여 표현 학습을 향상시킨다.
  • 소수의 예제 및 제로샷 프로토콜을 사용하여 다양한 NER 벤치마크에서 최종 분류기 헤드를 미세튜닝하여 훈련한다.
  • 여러 데이터셋을 통해 인라인 학습 및 미세튜닝을 통해 NuNER의 성능을 GPT-3.5, GPT-4 및 UniversalNER와 비교한다.
  • 데이터셋 크기, 엔티티 유형 다양성, 텍스트 다양성의 영향을 체계적으로 분석한다.
  • 분류기 헤드로 드롭아웃을 사용하는 두 층의 피드포워드 네트워크를 사용하며, 미세튜닝 동안 30 에포크 동안 훈련한다.
Figure 1: NuNER creation procedure. RoBERTa is further pre-trained on a subset of C4 automatically annotated by GPT-3.5. The resulting model can be fine-tuned on various downstream NER problems.
Figure 1: NuNER creation procedure. RoBERTa is further pre-trained on a subset of C4 automatically annotated by GPT-3.5. The resulting model can be fine-tuned on various downstream NER problems.

실험 결과

연구 질문

  • RQ1LLM에 의해 주석 처리된 데이터가 NER를 위한 작고 전용 기초 모델을 사전 훈련시키는 데 효과적으로 기능할 수 있는가?
  • RQ2소수의 예제 NER 설정에서 NuNER의 성능은 GPT-3.5 및 GPT-4와 같은 대규모 언어 모델과 비교해 어떻게 되는가?
  • RQ3데이터셋 크기, 엔티티 유형 다양성, 텍스트 다양성 중에서 어떤 요소가 작업 특화 기초 모델의 성능에 가장 큰 영향을 미치는가?
  • RQ4NuNER와 같이 더 작은 인코더 기반 모델이 UniversalNER와 같은 더 큰 생성형 모델의 성능을 따라하거나 뛰어넘을 수 있는가?
  • RQ5NuNER의 사전 훈련 절차가 최종 네트워크 레이어에서 엔티티 표현의 가용성을 향상시켜 소수의 예제 미세튜닝 효율성을 높이는가?

주요 결과

  • NuNER는 소수의 예제 설정에서 기초 RoBERTa 모델과 유사한 크기의 NER-BERT 사전 훈련 모델보다 뛰어난 성능을 보이며, LLM에 의해 주석 처리된 데이터의 효과성을 입증한다.
  • 소수의 예제 설정에서 8단어 이상의 엔티티 유형 단어를 사용할 경우 NuNER는 GPT-3.5를 능가하며, GPT-4와 경쟁할 수 있음을 보여주며, 이는 대규모 모델의 인라인 학습에 한계가 있음을 시사한다.
  • 56배 더 작은 크기임에도 불구하고, NuNER는 $k\sim2k$ 소수의 예제 설정에서 $64\sim128$ 단어에서 70.30±0.35 F1 스코어를 기록하며 UniversalNER와 유사한 성능을 달성한다.
  • 엔티티 유형 다양성과 데이터셋 크기가 NuNER의 성능에 가장 큰 영향을 미치며, 텍스트 다양성은 최소한의 영향을 미친다.
  • 대조 학습 사전 훈련 절차는 최종 네트워크 레이어에서 인간의 개념이 나타나는 데에 기여하며, 이는 소수의 예제 미세튜닝 효율성을 향상시킬 수 있다.
  • NuNER는 NER 작업에서 RoBERTa의 강력한 즉각 대체 모델이며, 최소한의 계산 비용으로 더 나은 소수의 예제 일반화 성능을 제공한다.
Figure 4: Frequency of each concept assigned by GPT-3.5, sorted from most to least common. We observe a heavy-tailed distribution.
Figure 4: Frequency of each concept assigned by GPT-3.5, sorted from most to least common. We observe a heavy-tailed distribution.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.