Skip to main content
QUICK REVIEW

[논문 리뷰] Old Content and Modern Tools - Searching Named Entities in a Finnish OCRed Historical Newspaper Collection 1771-1910

Kimmo Kettunen, Eetu Mäkelä|arXiv (Cornell University)|2016. 11. 09.
Natural Language Processing Techniques인용 수 8
한 줄 요약

이 논문은 1771–1910년 기간 동안의 대규모 OCR 처리된 핀란드어 역사적 신문 자료집에서 명명된 실체 인식(NER)을 평가한다. 이는 규칙 기반 FiNER 태거와 보조적 의미론적 도구를 사용한다. OCR 오류로 인해 단어 수준의 정확도가 약 70–75%로 낮아지지만, 이 연구는 핀란드어 역사적 텍스트에서의 첫 번째 대규모 NER 평가를 보고하며, 향후 디지털 인문학 및 언어 기술 응용 분야의 가능성을 입증하고 성능 기준을 제시한다.

ABSTRACT

Named Entity Recognition (NER), search, classification and tagging of names and name like frequent informational elements in texts, has become a standard information extraction procedure for textual data. NER has been applied to many types of texts and different types of entities: newspapers, fiction, historical records, persons, locations, chemical compounds, protein families, animals etc. In general a NER system's performance is genre and domain dependent and also used entity categories vary (Nadeau and Sekine, 2007). The most general set of named entities is usually some version of three partite categorization of locations, persons and organizations. In this paper we report first large scale trials and evaluation of NER with data out of a digitized Finnish historical newspaper collection Digi. Experiments, results and discussion of this research serve development of the Web collection of historical Finnish newspapers. Digi collection contains 1,960,921 pages of newspaper material from years 1771-1910 both in Finnish and Swedish. We use only material of Finnish documents in our evaluation. The OCRed newspaper collection has lots of OCR errors; its estimated word level correctness is about 70-75 % (Kettunen and P\\"a\\"akk\\"onen, 2016). Our principal NER tagger is a rule-based tagger of Finnish, FiNER, provided by the FIN-CLARIN consortium. We show also results of limited category semantic tagging with tools of the Semantic Computing Research Group (SeCo) of the Aalto University. Three other tools are also evaluated briefly. This research reports first published large scale results of NER in a historical Finnish OCRed newspaper collection. Results of the research supplement NER results of other languages with similar noisy data.

연구 동기 및 목표

  • 1771년에서 1910년까지의 기간을 아우르는 대규모 OCR 처리된 핀란드어 역사적 신문 자료집에서 명명된 실체 인식(NER)의 성능을 평가하는 것.
  • 지나치게 노이지가 많고 심각한 OCR 오류가 포함된 역사적 핀란드어 텍스트를 다룰 때 규칙 기반 및 의미론적 태깅 도구의 효과성을 평가하는 것.
  • Digi 디지털 신문 자료집에서 명명된 실체의 검색, 분류 및 태깅 향상을 위한 기반을 마련하는 것.
  • 알려진 OCR 품질을 고려한 첫 번째 대규모 공개 보고 NER 평가를 핀란드어 역사적 텍스트 분야에 기여하는 것.

제안 방법

  • 핀란드어 역사적 텍스트의 실체 태깅을 위해 FIN-CLARIN 컨sortium에서 개발한 규칙 기반 핀란드어 NER 시스템인 FiNER를 사용하였다.
  • 아우토 대학교의 의미 컴퓨팅 연구 그룹(SeCo)에서 개발한 의미론적 태깅 도구를 활용하여 실체의 카테고리 수준 의미 확장을 탐색하였다.
  • 동일한 데이터셋에서 시스템 간 성능을 비교하기 위해 추가로 세 가지 NER 도구를 간략히 평가하였다.
  • 언어적 일관성을 확보하기 위해 Digi 컬렉션의 핀란드어 문서만을 대상으로 하였으며 스웨덴어 자료는 제외하였다.
  • OCR 처리된 신문 페이지 총 1,960,921건의 데이터셋을 사용하였으며, OCR 오류로 인해 단어 수준 정확도가 약 70–75%로 추정되었다.
  • 표준 실체 카테고리인 개인, 장소, 조직에 대해 대규모 시험과 체계적인 NER 성능 평가를 수행하였다.

실험 결과

연구 질문

  • RQ1고도로 노이지가 많고 OCR 오류가 많은 핀란드어 역사적 신문에서 규칙 기반 NER(FiNER)가 명명된 실체를 식별하는 데 얼마나 효과적인가?
  • RQ2SeCo 도구의 의미론적 태깅은 동일한 역사적 텍스트 컬렉션 내 실체 카테고리의 의미적 확장을 얼마나 잘 수행하는가?
  • RQ3이러한 노이지가 많고 역사적인 핀란드어 텍스트 코퍼스에서 다양한 NER 도구의 정밀도, 재현율 및 F1-스코어 측면에서의 성능 비교는 어떻게 되는가?
  • RQ4Digi 컬렉션의 OCR 오류가 NER 시스템의 신뢰성과 확장성에 얼마나 큰 영향을 미치는가?

주요 결과

  • OCR 오류가 존재하는 상황에서도 FiNER 규칙 기반 NER 시스템은 핀란드어 역사적 신문 자료집에서 측정 가능한 성능을 달성하였으며, 향후 향상의 기초가 되는 기준을 설정하였다.
  • 이 연구는 핀란드어 역사적 텍스트에서의 NER에 대해 첫 번째 대규모 평가를 보고하며, 디지털 인문학 및 언어 기술 연구 분야에서 중요한 격차를 메웠다.
  • SeCo 도구를 활용한 의미론적 태깅은 추가적인 카테고리 수준의 의미 확장을 제공했지만, 노이지가 많은 OCR 입력으로 인해 성능에 한계가 있었다.
  • 실체 유형 간 성능에 큰 차이가 있었으며, 개인과 장소의 경우 조직보다 더 높은 인식률을 보였는데, 이는 철자 변형과 철자 일관성 부족으로 인한 것으로 보인다.
  • 전반적인 F1-스코어는 OCR 오류로 제한되었으며, 단어 수준 정확도가 약 70–75%로 추정되어, 후속 NLP 파이프라인에서 강력한 오류 보정 기술이 필요함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.