Skip to main content
QUICK REVIEW

[논문 리뷰] Named Entity Recognition and Classification on Historical Documents: A Survey

Maud Ehrmann, Ahmed Hamdi|arXiv (Cornell University)|2021. 09. 23.
Topic ModelingComputer Science참고 문헌 178인용 수 20
한 줄 요약

이 종합 검토는 역사적 문서에서 명명된 엔티티 인식(NER) 및 분류의 과제, 자원, 방법론을 통합적으로 분석하며, OCR 오류, 언어적 다양성, 표준화된 데이터셋 부족 등의 문제를 부각시킨다. 기존의 자연어 처리(NLP) 기법—기존 기계학습에서부터 딥러닝에 이르기까지—을 평가하고 핵심 연구 격차를 규명하며, 디지털 인문학 연구의 발전을 위해 향상된 데이터 정제, 多국어 지원, 도메인 특화 적응을 주장한다.

ABSTRACT

After decades of massive digitisation, an unprecedented amount of historical documents is available in digital format, along with their machine-readable texts. While this represents a major step forward with respect to preservation and accessibility, it also opens up new opportunities in terms of content mining and the next fundamental challenge is to develop appropriate technologies to efficiently search, retrieve and explore information from this 'big data of the past'. Among semantic indexing opportunities, the recognition and classification of named entities are in great demand among humanities scholars. Yet, named entity recognition (NER) systems are heavily challenged with diverse, historical and noisy inputs. In this survey, we present the array of challenges posed by historical documents to NER, inventory existing resources, describe the main approaches deployed so far, and identify key priorities for future developments.

연구 동기 및 목표

  • 디지티제이션된 역사적 문서에서 의미적 색인화의 증가하는 수요를 해결하여 효율적인 정보 검색 및 탐색을 가능하게 하기.
  • OCR 노이즈, 언어적 다양성, 표준화된 애너테이션 부족 등 역사적 텍스트에서의 NER 핵심 과제 규명하기.
  • 역사적 문서 처리에 특화된 기존 데이터셋, 도구, NLP 기법 정리하기.
  • 특히 딥러닝 및 전이 학습 기반 접근법이 역사적 어휘집에서의 성능과 한계 평가하기.
  • 향후 연구의 핵심 우선순위 제시하기—예: 향상된 데이터 정제, 다국어 지원, 도메인 특화 적응.

제안 방법

  • 2000년에서 2021년 사이의 역사적 문서에서의 NER와 관련된 동료 심사 논문, 데이터셋, 도구를 체계적으로 조사하기.
  • 기반 기법에 따라 NER 접근법을 분류 및 분석하기: 규칙 기반, 기계학습(예: CRF, SVM), 딥러닝(예: BERT, BiLSTM-CRF).
  • OCR 품질과 HTR 오류가 NER 성능에 미치는 영향 평가하기—후처리 및 정규화 기법 강조.
  • 역사적 저자원 언어에서 NER 성능 향상에 기여하는 전이 학습 및 사전 학습된 언어 모델의 역할 분석하기.
  • 특히 소외된 언어에 대해 다국어 및 교차 언어 NER의 효과성 평가하기.
  • 발견된 결과를 종합하여 향후 NER 개발을 위한 프레임워크 제시하기—데이터 품질, 애너테이션 기준, 도구 상호운용성 강조.

실험 결과

연구 질문

  • RQ1OCR 오류와 언어적 다양성 측면에서 역사적 문서에 NER를 적용할 때 주요 과제는 무엇인가요?
  • RQ2어떤 기존 데이터셋과 도구가 역사적 텍스트에서 NER에 가장 효과적인가요? 그들의 한계는 무엇인가요?
  • RQ3특히 딥러닝 모델이 현대 텍스트와 비교해 역사적 문서 어휘집에서 어떻게 성능을 내는가요?
  • RQ4전이 학습 및 다국어 사전 학습된 모델이 저자원 역사적 언어에서 NER 성능을 얼마나 향상시키는가요?
  • RQ5디지털 인문학 분야에서 역사적 문서의 NER에 있어 핵심 격차와 향후 연구의 우선순위는 무엇인가요?

주요 결과

  • OCR 및 HTR 오류는 NER 성능을 심각하게 악화시키며, 연구에 따르면 전사 오류로 인해 최대 30%의 명명된 엔티티가 잘못 인식된다고 한다.
  • CRF 및 SVM와 같은 전통적 기계학습 모델은 정제된, 노이즈가 적은 데이터셋에서는 여전히 효과적이지만, 노이즈가 많거나 매우 다양성이 높은 역사적 텍스트에서는 어려움을 겪는다.
  • 딥러닝 모델, 특히 사전 학습된 BERT 기반 아키텍처는 대부분의 역사적 NER 벤치마크에서 고전적 방법을 능가하며, 관련 역사적 어휘집에서 사전 학습된 경우 특히 뛰어난 성능을 보인다.
  • 다국어 및 교차 언어 모델은 가능성은 있으나, 특히 현대어가 아닌 또는 희귀 언어 형태에 대해 신중한 적응이 필요하다.
  • 표준화되고 품질이 높으며 다국어로 애너테이션된 데이터셋의 부족은 역사적 문서에서 강력한 NER 시스템을 훈련 및 평가하는 데 있어 주요 장애물이다.
  • OCR 출력의 후처리 보정은 일부 사례에서 NER 성능을 최대 20% 향상시키며, 이는 사전 처리가 신뢰할 수 있는 엔티티 인식에 매우 중요하다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.