Skip to main content
QUICK REVIEW

[논문 리뷰] hmBERT: Historical Multilingual Language Models for Named Entity Recognition

Stefan Schweter, Luisa März|arXiv (Cornell University)|2022. 05. 31.
Topic Modeling인용 수 13
한 줄 요약

이 논문은 독일어, 영어, 프랑스어, 스웨덴어, 핀란드어로 된 역사적 OCR 처리 텍스트를 기반으로 사전 훈련한 다국어 BERT 기반 언어 모델인 hmBERT를 소개한다. 이는 자원이 적은 역사적 도메인에서 이름 있는 엔티티 인식(NER) 성능을 향상시키기 위한 것이다. 고신뢰도 OCR 코퍼스를 대상으로 자기지도 학습을 수행하고 도메인 특화 토크나이저와 다단계 미세조정을 활용함으로써, hmBERT는 HIPE-2022 NERC-Coarse 챌린지에서 최고 성능을 기록하였으며, 세 언어 중 두 언어에서 다른 시스템을 능가하였다.

ABSTRACT

Compared to standard Named Entity Recognition (NER), identifying persons, locations, and organizations in historical texts constitutes a big challenge. To obtain machine-readable corpora, the historical text is usually scanned and Optical Character Recognition (OCR) needs to be performed. As a result, the historical corpora contain errors. Also, entities like location or organization can change over time, which poses another challenge. Overall, historical texts come with several peculiarities that differ greatly from modern texts and large labeled corpora for training a neural tagger are hardly available for this domain. In this work, we tackle NER for historical German, English, French, Swedish, and Finnish by training large historical language models. We circumvent the need for large amounts of labeled data by using unlabeled data for pretraining a language model. We propose hmBERT, a historical multilingual BERT-based language model, and release the model in several versions of different sizes. Furthermore, we evaluate the capability of hmBERT by solving downstream NER as part of this year's HIPE-2022 shared task and provide detailed analysis and insights. For the Multilingual Classical Commentary coarse-grained NER challenge, our tagger HISTeria outperforms the other teams' models for two out of three languages.

연구 동기 및 목표

  • OCR 오류, 도메인 이탈, 레이블이 부족한 데이터로 인한 자원이 적은 역사적 텍스트에서의 이름 있는 엔티티 인식(NER) 문제를 해결한다.
  • 독일어, 영어, 프랑스어, 스웨덴어, 핀란드어의 역사적 텍스트에 특화된 다국어 언어 모델을 개발한다. 이는 자기지도 학습 기반으로 한다.
  • 저신뢰도 OCR 출력을 필터링하고 도메인 특화 서브워드 어휘를 구축함으로써 OCR 노이즈와 어휘 불일치 문제를 완화한다.
  • 하위 작업 NER 작업에서의 모델 성능을 평가하며, 특히 HIPE-2022 공동 과제의 맥락에서 성능을 분석한다.
  • 향후 역사적 NLP 및 다국어 NER 연구를 지원하기 위해 공개된 모델과 코드를 제공한다.

제안 방법

  • 다양한 출처에서 확보한 대규모 비라벨 역사적 텍스트(예: OCR 처리된 신문 및 수기)를 기반으로 다국어 BERT 기반 모델(hmBERT)을 사전 훈련한다.
  • 저품질 OCR 결과를 줄이기 위해 높은 OCR 신뢰도 점수를 가진 텍스트만 유지하는 필터링 단계를 적용한다.
  • 사전 훈련 데이터의 대표적 서브코퍼스에서 도메인 특화 서브워드 어휘(32k 및 64k 어휘 크기)를 구축하여 역사적 용어의 커버리지 향상.
  • 다단계 미세조정 전략을 사용하여 hmBERT 모델을 미세조정한다: 첫 번째 단계는 다국어 NER 데이터셋에서, 두 번째 단계는 각 언어별로 개별적으로 수행한다.
  • 훈련 데이터에서 긴 's'(ſ) 문자를 수동으로 's'로 대체하여 UNK 토큰을 방지함으로써 토크나이제이션 문제를 해결한다.
  • HIPE-2022 다국어 고전 주석 NER 챌린지에서 성능을 평가하고, 단일 모델 vs. 한 모델에 대한 미세조정 전략을 비교한다.

실험 결과

연구 질문

  • RQ1고신뢰도 역사적 OCR 코퍼스를 기반으로 사전 훈련한 다국어 BERT 기반 언어 모델이 자원이 적은 역사적 언어 환경에서 NER 성능을 향상시킬 수 있는가?
  • RQ2일반 도메인 어휘와 비교할 때 역사적 텍스트 처리에서 도메인 특화 어휘 사용이 NER 성능에 어떤 영향을 미치는가?
  • RQ3다단계 미세조정(먼저 다국어 설정에서, 그 후 각 언어별로)이 단일 모델에서의 종단 간 미세조정보다 더 높은 성능을 내는가?
  • RQ4아키텍처 선택(예: BERT 대비 ELECTRA)이 OCR 노이즈가 있는 역사적 텍스트에서의 하위 작업 NER 성능에 어떤 영향을 미치는가?
  • RQ5역사적 텍스트의 시기 분포 불균형(예: 18세기~19세기)이 모델 일반화 능력에 어떤 영향을 미치며, 이를 어떻게 완화할 수 있는가?

주요 결과

  • hmBERT는 네 언어 중 세 언어(French, Finnish, Swedish)에서 NewsEye NER 데이터셋에서 최고 성능을 기록하였다.
  • HIPE-2022 다국어 고전 주석 NER 챌린지에서 HISTeria 시스템은 세 언어 중 두 언어에서 다른 팀의 모델을 능가하였다.
  • 단일 모델 미세조정 전략(모델별 언어 특화 미세조정)은 더 높은 성능을 기록했지만, 상당한 계산 비용 증가를 수반하였다.
  • 한 모델 전략은 더 효율적이며 유사한 성능을 기록하여, 계산 자원이 제한된 환경에서 실용적인 대안이 되었다.
  • 도메인 특화 어휘 사용과 OCR 신뢰도 필터링은 모델의 강건성과 엔티티 인식 정확도를 크게 향상시켰다.
  • 동일한 코퍼스에서 훈련한 ELECTRA 기반 모델은 하위 작업 NER 작업에서 BERT 기반 모델보다 1~3%p 낮은 성능을 기록하여, 공개하지 않기로 결정하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.