Skip to main content
QUICK REVIEW

[論文レビュー] Old Content and Modern Tools - Searching Named Entities in a Finnish OCRed Historical Newspaper Collection 1771-1910

Kimmo Kettunen, Eetu Mäkelä|arXiv (Cornell University)|Nov 9, 2016
Natural Language Processing Techniques被引用数 8
ひとこと要約

本論文は、1771年から1910年までの大型OCR処理済みフィンランド語歴史的新聞コレクションにおいて、ルールベースのFiNERタッパーと補足的な意味的ツールを用いて名前付きエンティティ認識(NER)を評価している。OCRエラーにより単語レベルの正確性が約70–75%に低下するが、本研究はフィンランド語歴史的テキストにおける最初の大規模NER評価を報告し、今後のデジタル・ヒューマニティーズおよび言語技術アプリケーションにおける実現可能性とパフォーマンスのベンチマークを示している。

ABSTRACT

Named Entity Recognition (NER), search, classification and tagging of names and name like frequent informational elements in texts, has become a standard information extraction procedure for textual data. NER has been applied to many types of texts and different types of entities: newspapers, fiction, historical records, persons, locations, chemical compounds, protein families, animals etc. In general a NER system's performance is genre and domain dependent and also used entity categories vary (Nadeau and Sekine, 2007). The most general set of named entities is usually some version of three partite categorization of locations, persons and organizations. In this paper we report first large scale trials and evaluation of NER with data out of a digitized Finnish historical newspaper collection Digi. Experiments, results and discussion of this research serve development of the Web collection of historical Finnish newspapers. Digi collection contains 1,960,921 pages of newspaper material from years 1771-1910 both in Finnish and Swedish. We use only material of Finnish documents in our evaluation. The OCRed newspaper collection has lots of OCR errors; its estimated word level correctness is about 70-75 % (Kettunen and P\\"a\\"akk\\"onen, 2016). Our principal NER tagger is a rule-based tagger of Finnish, FiNER, provided by the FIN-CLARIN consortium. We show also results of limited category semantic tagging with tools of the Semantic Computing Research Group (SeCo) of the Aalto University. Three other tools are also evaluated briefly. This research reports first published large scale results of NER in a historical Finnish OCRed newspaper collection. Results of the research supplement NER results of other languages with similar noisy data.

研究の動機と目的

  • 1771年から1910年までをカバーする大規模でOCR処理済みのフィンランド語歴史的新聞コレクションにおける名前付きエンティティ認識(NER)のパフォーマンスを評価すること。
  • 顕著なOCRエラーを伴うノイジィな歴史的フィンランド語テキストに対処するためのルールベースおよび意味的タギングツールの有効性を評価すること。
  • Digiデジタル新聞コレクションにおける名前付きエンティティの検索、分類、タギングの改善の基盤を提供すること。
  • OCR品質が既知のフィンランド語歴史的テキストにおける最初の大規模で公に報告されたNER評価を貢献すること。

提案手法

  • フィンランド語歴史的テキストにおけるエンティティタギングに、FIN-CLARINコンsortiumが開発したルールベースのフィンランド語NERシステムFiNERを用いた。
  • オウル大学の意味コンピューティング研究グループ(SeCo)が開発した意味的タギングツールを用い、カテゴリレベルの意味的拡張を検討した。
  • 同じデータセット上でシステム間のパフォーマンスを比較するため、3つの追加のNERツールを一時的に評価した。
  • 言語的一致性を確保するため、スウェーデン語コンテンツを除いたDigiコレクションのフィンランド語文書に焦点を当てた。
  • OCR処理済みの新聞ページ1,960,921件のデータセットを用い、OCRエラーの影響により単語レベルの正確性が推定70–75%であった。
  • 標準的なエンティティカテゴリ(人物、場所、組織)におけるNERパフォーマンスの包括的で大規模な試行と体系的評価を実施した。

実験結果

リサーチクエスチョン

  • RQ1OCR誤り率の高いフィンランド語歴史的新聞において、ルールベースのNER(FiNER)は名前付きエンティティを同定するのにどの程度効果的か?
  • RQ2同じ歴史的テキストコレクション内での意味的タギングツール(SeCo)のカテゴリレベルの意味的拡張におけるパフォーマンスはいかほどか?
  • RQ3ノイジィで歴史的なフィンランド語テキストコーパスにおいて、異なるNERツールの精度、再現率、F1スコアの違いは何か?
  • RQ4DigiコレクションにおけるOCRエラーは、NERシステムの信頼性とスケーラビリティにどの程度影響を及えるか?

主な発見

  • OCRエラーが存在する中でも、FiNERのルールベースNERシステムは測定可能なパフォーマンスを示し、今後の改善のためのベースラインを確立した。
  • 本研究は、デジタル・ヒューマニティーズおよび言語技術分野の研究において、極めて重要な空白を埋める、フィンランド語歴史的テキストにおける最初の大規模なNER評価を報告した。
  • SeCoツールによる意味的タギングは、追加のカテゴリレベルの拡張を提供したが、ノイジィなOCR入力の影響でパフォーマンスは制限された。
  • エンティティタイプごとのパフォーマンスに顕著な差が認められ、人物と場所は組織よりも高い認識率を示した。これは、綴りのばらつきや綴りの不一致が主な要因と考えられる。
  • 全体のF1スコアはOCRエラーの影響で制限されており、単語レベルの正確性が70–75%と推定された。これは、後続のNLPパイプラインにおける堅牢な誤り訂正の必要性を強調している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。