Skip to main content
QUICK REVIEW

[논문 리뷰] Named entity recognition in chemical patents using ensemble of contextual language models

Jenny Copara, Nona Naderi|arXiv (Cornell University)|2020. 07. 24.
Biomedical Text Mining and Ontologies인용 수 11
한 줄 요약

이 논문은 화학 특허에서 복잡하고 종종 지적 재산권을 보호하기 위해 은폐된 텍스트를 다루는 데 어려움을 겪는 Named Entity Recognition (NER)를 향상시키기 위해 컨텍스트 기반 언어 모델의 앙상블—특히 BERT 기반 아키텍처—를 제안한다. 다수의 모델 예측을 다수결 투표 방식으로 조합함으로써, ChEMU NER 벤치마크에서 최신 기술 수준의 정확한 F1 스코어 92.30%와 유연한 F1 스코어 96.24%를 달성하였으며, 이는 개별 모델의 한계를 효과적으로 완화시킨다는 것을 보여준다.

ABSTRACT

Chemical patent documents describe a broad range of applications holding key reaction and compound information, such as chemical structure, reaction formulas, and molecular properties. These informational entities should be first identified in text passages to be utilized in downstream tasks. Text mining provides means to extract relevant information from chemical patents through information extraction techniques. As part of the Information Extraction task of the Cheminformatics Elsevier Melbourne University challenge, in this work we study the effectiveness of contextualized language models to extract reaction information in chemical patents. We assess transformer architectures trained on a generic and specialised corpora to propose a new ensemble model. Our best model, based on a majority ensemble approach, achieves an exact F1-score of 92.30% and a relaxed F1-score of 96.24%. The results show that ensemble of contextualized language models can provide an effective method to extract information from chemical patents.

연구 동기 및 목표

  • 특허에서 지적 재산권을 보호하기 위해 종종 은폐된 복잡한 텍스트를 다루는 화학 특허의 명명된 실체 인식(NER)을 향상시키기 위해.
  • 도메인 특화 사전 훈련 없이도 컨텍스트 기반 언어 모델—특히 BERT 변종—이 화학 특허 NER에 얼마나 효과적인지 평가하기 위해.
  • 다양한 트랜스포머 기반 모델을 앙상블하여 개별 모델이나 전통적인 CRF 기반 모델보다 성능을 향상시킬 수 있는지 조사하기 위해.
  • 특히 반응물, 촉매, 시약와 같은 장기 스팬 실체에 대해 자주 잘못 분류되는 오류 패턴을 분석하기 위해.

제안 방법

  • ChEMU NER 데이터셋에 대해 토큰 분류를 위한 다섯 개의 BERT 기반 모델—bert-base-cased, bert-base-uncased, bert-large-cased, bert-large-uncased, 그리고 ChemBERTa—를 미세조정하였다.
  • 모든 다섯 개의 모델 예측을 조합하기 위해 다수결 투표 앙상블 전략을 적용하여 정확도를 높이고 개별 모델의 오류를 감소시켰다.
  • 표준 BERT 토크나이저와 교차 엔트로피 손실을 사용한 미세조정 절차를 각 실체 클래스의 레이블이 부여된 훈련 세트에 적용하였다.
  • 정확한 F1 스코어와 유연한 F1 스코어를 사용하여 모델 성능을 평가하였으며, 후자는 예측된 스팬과 정답 스팬 간의 부분 일치를 允허하였다.
  • 개발 세트에서 오류 분석을 수행하여, 특히 장기적이거나 일관되지 않게 애너테이션된 실체에 대해 흔히 발생하는 실패 유형을 규명하였다.
  • 성능 기준을 설정하기 위해 CRF 기반 모델과 경쟁 기준 모델과의 결과를 비교하였다.

실험 결과

연구 질문

  • RQ1사전 훈련된 컨텍스트 기반 언어 모델의 앙상블이 화학 특허 NER에서 개별 모델보다 우수한 성능을 낼 수 있는가?
  • RQ2도메인 특화 사전 훈련 없이도 일반 도메인 BERT 모델이 특허 내 화학 실체를 인식하는 데 얼마나 효과적인가?
  • RQ3화학 특허 NER에서 가장 흔한 오류 유형은 무엇이며, 특히 장기적 또는 다단어 실체에 대해 어떤 오류가 자주 발생하는가?
  • RQ4다양한 BERT 변종 간의 다수결 투표가 단일 모델 예측보다 오류율을 낮출 수 있는가?
  • RQ5왜 더 큰 모델인 BERT-large가 이 NER 작업에서 항상 더 작은 모델보다 뛰어나지 않는가?

주요 결과

  • 앙상블 모델은 정확한 F1 스코어 92.30%와 유연한 F1 스코어 96.24%를 기록하여, CRF 기반 모델(80.56%)과 경쟁 기준 모델(88.93%)을 크게 능가하였다.
  • 수익률 관련 실체에 대해 모델의 성능이 특히 뛰어나며, 수익률 백분율에 대해 99.74%의 F1 스코어를 기록하여 잘 정의된 용어에 대해 높은 정밀도와 재현율을 보였다.
  • 오류 분석 결과, 스팬 오류의 78.8%가 너무 긴 예측으로, 예를 들어 '물에 녹은' 또는 '농축된' 등의 수식어를 포함하여 시약 이름에 포함된 경우였다.
  • 가장 흔한 혼동은 starting_material과 reagent_catalyst 사이, 그리고 reaction_product와 other_compound 사이에서 발생하였으며, 이는 화학 텍스트 내 의미적 중첩 때문일 가능성이 높다.
  • 더 긴 실체—특히 reagent_catalyst, reaction_product, starting_material—는 오류 발생에 더 취약했으며, 일부 모델(예: bert-large-uncased)은 스팬의 어떤 토큰도 탐지하지 못하는 경우가 있었다.
  • 앙상블 모델은 개별 BERT 모델 대비 장기 스팬에서의 오류를 감소시켰으며, 이는 다양한 예측을 조합함으로써 서브워드 토크나이저의 한계를 보완할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.