[논문 리뷰] GLiNER: Generalist Model for Named Entity Recognition using Bidirectional Transformer
GLiNER는 공통 잠재 공간 내에서 엔티티 유형 임베딩과 스파닝 표현 간의 매칭 작업으로서 엔티티 인식을 다루는, 작고 양방향 트랜스포머 기반의 제로샷 명명된 실체 인식(NER)을 위한 모델이다. 이는 챗지피티 및 미세조정된 대규모 언어 모델(LM)보다 제로샷 NER 벤치마크에서 뛰어난 성능을 보이며, 동시에 빠르고 병렬 처리 가능한 추론을 가능하게 하여 자원이 제한된 환경에서도 효율적이다.
Named Entity Recognition (NER) is essential in various Natural Language Processing (NLP) applications. Traditional NER models are effective but limited to a set of predefined entity types. In contrast, Large Language Models (LLMs) can extract arbitrary entities through natural language instructions, offering greater flexibility. However, their size and cost, particularly for those accessed via APIs like ChatGPT, make them impractical in resource-limited scenarios. In this paper, we introduce a compact NER model trained to identify any type of entity. Leveraging a bidirectional transformer encoder, our model, GLiNER, facilitates parallel entity extraction, an advantage over the slow sequential token generation of LLMs. Through comprehensive testing, GLiNER demonstrate strong performance, outperforming both ChatGPT and fine-tuned LLMs in zero-shot evaluations on various NER benchmarks.
연구 동기 및 목표
- 사전에 정의된 레이블이 필요 없이 임의의 엔티티 유형을 인식할 수 있는 일반화된 NER 모델을 개발하는 것.
- 자기회귀적 대규모 언어 모델(LM)의 한계, 즉 느린 순차적 생성 및 높은 계산 비용을 극복하는 것.
- 작고 양방향 트랜스포머 아키텍처를 사용하여 효율적이고 병렬적인 엔티티 추출을 가능하게 하는 것.
- 다양한 도메인과 저자원 언어에서의 제로샷 성능 향상.
- 부정적 엔티티 샘플링 및 엔티티 유형 제거와 같은 데이터 증강 기법을 통해 모델의 강건성 향상.
제안 방법
- GLiNER는 통합된 입력 시퀀스인 엔티티 유형 프롬프트와 소스 텍스트로부터 문맥 기반 토큰 표현을 생성하기 위해 양방향 트랜스포머 인코더(예: BERT 또는 deBERTa)를 사용한다.
- 모델은 입력 텍스트 내 모든 가능한 스팬에 대한 조밀한 임베딩을 토큰 표현을 사용해 계산하는 스팬 표현 모듈을 활용한다.
- 엔티티 유형 프롬프트는 전용 엔티티 표현 모듈을 통해 공통 잠재 공간에 임베딩된다.
- 스패닝 표현과 엔티티 임베딩 간의 매칭 점수는 내적곱을 통해 계산되고, 이후 시그모이드 활성화 함수를 적용하여 엔티티 유형을 예측한다.
- 학습 중 50% 비율로 부정적 엔티티 유형을 샘플링하여 정밀도 향상과 거짓 양성률 감소를 도모한다.
- 학습 중에는 입력당 랜덤한 부분 집합의 엔티티 프롬프트를 마스킹하는 엔티티 유형 제거 기법을 적용하여 입력 복잡도의 변동에 대한 모델의 강건성 향상.

실험 결과
연구 질문
- RQ1작고 자기회귀적이지 않은 양방향 트랜스포머 기반 모델이 제로샷 NER에서 대규모 자기회귀적 대규모 언어 모델(LM)을 능가할 수 있는가?
- RQ2잠재 공간 내에서 NER를 매칭 작업으로 간주할 경우, 자기회귀적 생성 대비 더 빠르고 병렬 추론이 가능한가?
- RQ3부정적 엔티티 샘플링은 개방형 어휘 NER에서 정밀도와 재현율의 균형에 어떤 영향을 미치는가?
- RQ4다양하고 개방형 도메인 데이터로 미세조정된 모델이 학습 중에 볼 수 없었던 저자원 언어로의 일반화 능력은 어느 정도인가?
- RQ5엔티티 유형 제거와 같은 데이터 증강 전략이 제로샷 일반화 및 강건성 향상에 기여하는가?
주요 결과
- GLiNER는 여러 데이터셋에서 챗지피티 및 미세조정된 대규모 언어 모델(LM)보다 제로샷 NER 벤치마크에서 더 높은 F1 스코어를 기록하며 뛰어난 성능을 보였다.
- 학습 데이터가 1개 데이터셋당 100개 샘플로 제한된 경우 5.6%의 성능 향상을 기록하여 강력한 희소한 샘플 일반화 능력을 입증했다.
- 50%의 부정적 엔티티 샘플링 전략을 적용했을 때 정밀도(62.3%)와 재현율(59.7%) 간의 균형이 가장 우수했으며, 0% 및 75% 전략보다 뛰어난 성능을 보였다.
- 학습 데이터에 포함되지 않은 10개의 저자원 언어 중 8개에서 챗지피티를 초월하여 강력한 제로샷 다국어 일반화 능력을 입증했다.
- 학습 중 엔티티 유형 제거 기법을 적용함으로써 도메인 외부 평가 성능이 평균 1.4 F1 포인트 이상 향상되었다.
- Pile-NER 데이터셋에서의 사전학습은 특히 데이터가 적은 환경에서 성능을 크게 향상시켜 대규모 다양한 데이터로부터의 긍정적 전이 성공을 입증했다.
![Figure 2: Model architecture . GLiNER employs a BiLM and takes as input entity type prompts and a sentence/text. Each entity is separated by a learned token [ENT] . The BiLM outputs representations for each token. Entity embeddings are passed into a FeedForward Network, while input word representati](https://ar5iv.labs.arxiv.org/html/2311.08526/assets/x2.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.