Skip to main content
QUICK REVIEW

[논문 리뷰] Domain-Specific NER via Retrieving Correlated Samples

Xin Zhang, Yong Jiang|arXiv (Cornell University)|2022. 08. 27.
Topic Modeling인용 수 9
한 줄 요약

이 논문은 도메인 특화 NER 접근법을 제안하며, 도메인 내 텍스트에서 관련 없는 레이블이 없는 샘플을 검색하고 활용하여 모델 성능을 햖थ한다. BM25 검색과 다중 인스턴스 크로스 인코더를 사용해 상관관계를 모델링하고, 투표와 공동 인코딩을 통해 엔터티 유형 예측을 향상시켜 중국어 주소 및 전자상거래 NER 벤치마크에서 최신 기준 성능을 달성하며, 강력한 기준 모델 대비 F1 점수로 최대 1.11점 향상됨.

ABSTRACT

Successful Machine Learning based Named Entity Recognition models could fail on texts from some special domains, for instance, Chinese addresses and e-commerce titles, where requires adequate background knowledge. Such texts are also difficult for human annotators. In fact, we can obtain some potentially helpful information from correlated texts, which have some common entities, to help the text understanding. Then, one can easily reason out the correct answer by referencing correlated samples. In this paper, we suggest enhancing NER models with correlated samples. We draw correlated samples by the sparse BM25 retriever from large-scale in-domain unlabeled data. To explicitly simulate the human reasoning process, we perform a training-free entity type calibrating by majority voting. To capture correlation features in the training stage, we suggest to model correlated samples by the transformer-based multi-instance cross-encoder. Empirical results on datasets of the above two domains show the efficacy of our methods.

연구 동기 및 목표

  • 중국어 주소나 전자상거래 타이틀처럼 배경 지식 없이 엔터티가 모호한 도메인 특화 텍스트에서 NER 성능이 열 劣한 문제를 해결한다.
  • 입력 샘플을 상호 독립적인 것으로 간주하는 표준 NER 모델이 어려운 모호한 케이스에서 실패하는 한계를 극복한다.
  • 동일 도메인에서 자연스럽게 관련 있는 레이블이 없는 샘플을 활용해 엔터티 인식을 위한 해석적 맥락을 제공한다.
  • 검색된 샘플 간 다수결 투표를 통한 훈련 없이 보정하는 방법을 개발하여 예측된 엔터티 유형을 정밀하게 보정한다.
  • 훈련 중에 입력 샘플과 검색된 샘플 간의 상관관계를 명시적으로 모델링하기 위해 다중 인스턴스 크로스 인코더를 제안한다.

제안 방법

  • 대규모 도메인 내 레이블이 없는 텍스트에서 어휘 유사도를 기반으로 Elasticsearch 기반의 희소 BM25 검색기를 사용해 관련 샘플을 검색한다.
  • 입력 샘플과 검색된 샘플에서 병렬 추론을 수행한 후 다수결 투표를 통해 모호성을 해소함으로써 엔터티 유형을 보정한다.
  • 입력 샘플과 검색된 샘플을 함께 인코딩하는 트랜스포머 기반의 다중 인스턴스 크로스 인코더를 훈련하여 복잡한 상관관계 특징을 포착한다.
  • NEZHA를 문맥 표현으로 사용하여 BiLSTM-CRF 프레임워크에 크로스 인코더를 통합함으로써 관련 패턴의 엔드 투 엔드 학습을 가능하게 한다.
  • 크로스 인코더를 통해 입력 텍스트와 검색된 텍스트 양쪽에 주목하게 하여, 예측에 유용한 맥락을 동적으로 가중치를 조정할 수 있도록 한다.
  • 반복 계산을 줄이고 속도를 향상시키기 위해 CRF 디코딩 이전에 검색된 텍스트를 연결하여 추론을 최적화한다.

실험 결과

연구 질문

  • RQ1도메인 내 데이터에서 관련 없는 레이블이 없는 샘플을 검색함으로써 모호한 도메인 특화 텍스트에서 NER 성능을 향상시킬 수 있는가?
  • RQ2검색된 샘플에 대한 다수결 투표를 통한 훈련 없이 보정한 엔터티 유형 예측이 NER 정확도 향상에 일관되게 기여하는가?
  • RQ3입력 샘플과 검색된 샘플을 함께 모델링하는 다중 인스턴스 크로스 인코더가 표준 NER 모델보다 더 풍부한 상관관계 특징을 포착할 수 있는가?
  • RQ4레이블이 없는 검색 코퍼스의 크기와 품질이 제안된 방법의 성능에 어떤 영향을 미치는가?
  • RQ5검색 증강 NER 방법을 사용할 때 성능 향상과 추론 속도 간의 상호 보완적 관계는 어떠한가?

주요 결과

  • 제안된 방법은 주소 데이터셋의 개발 세트에서 최신 기준 F1 점수 93.89를 기록하여 기준 모델인 NEZHA-BiLSTM-CRF 대비 1.11점 향상됨.
  • 엔터티 투표 방법은 기준 모델 대비 F1 점수를 0.58점 향상시켜 크로스 인스턴스 보정의 효과성을 입증함.
  • 다중 인스턴스 크로스 인코더는 주소 및 전자상거래 데이터셋 양쪽에서 NEZHA-BC와 같은 강력한 모델을 포함한 모든 기준 모델을 초월함.
  • 성능 향상은 상위 10개의 검색 샘플에서 가장 두드러졌으며, 이 이상의 수치에서는 수익 감소 현상이 나타남.
  • 크로스 인코더 방법은 기준 모델 대비 런타임이 2배 빠르게, 4,000개 샘플 테스트 세트에서 38.41초의 실행 시간을 기록하여 실세계 적용에 실용적임.
  • 작거나 품질이 낮은 레이블이 없는 코퍼스는 관련 있는 검색 샘플 수를 줄이고 성능 향상도 감소시켜 데이터 품질의 중요성을 강조함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.