Skip to main content
QUICK REVIEW

[論文レビュー] State of the Art Optical Character Recognition of 19th Century Fraktur Scripts using Open Source Engines

Christian Reul, Uwe Springmann|arXiv (Cornell University)|Oct 8, 2018
Handwritten Text Recognition Techniques被引用数 10
ひとこと要約

本稿では、合成データではなく多様な実世界データに基づく混合モデルを用いて、19世紀のFraktur書体のオープンソースOCRエンジンの評価を実施している。本研究では、新しいOCRエンジンCalamariがTesseractおよびOCRopusを大きく上回り、ABBYの文字誤り率(CER)を70%以上低減し、未学習の歴史的文書において平均CERが1%未満に達することを示している。

ABSTRACT

In this paper we evaluate Optical Character Recognition (OCR) of 19th century Fraktur scripts without book-specific training using mixed models, i.e. models trained to recognize a variety of fonts and typesets from previously unseen sources. We describe the training process leading to strong mixed OCR models and compare them to freely available models of the popular open source engines OCRopus and Tesseract as well as the commercial state of the art system ABBYY. For evaluation, we use a varied collection of unseen data from books, journals, and a dictionary from the 19th century. The experiments show that training mixed models with real data is superior to training with synthetic data and that the novel OCR engine Calamari outperforms the other engines considerably, on average reducing ABBYYs character error rate (CER) by over 70%, resulting in an average CER below 1%.

研究の動機と目的

  • 書籍特有の訓練なしに19世紀のFraktur書体におけるオープンソースOCRエンジンの性能を評価すること。
  • 合成データではなく実際の歴史的データに基づいて訓練された混合モデルが、合成データで訓練されたモデルを上回るかを調査すること。
  • 最新のオープンソースOCRエンジンCalamariを、TesseractやOCRopusといった既存のエンジン、および商業的システムABBYと比較すること。
  • 書籍、ジャーナル、辞書を含む多様な未学習の歴史的資料におけるOCR性能を評価すること。
  • オープンソースツールと実際の訓練データのみを用いて、Fraktur書体の高精度OCRのベンチマークを確立すること。

提案手法

  • 複数のソースから得た多様な19世紀のFraktur文書の実際のデータを用いて、混合OCRモデルを訓練すること。
  • 実データと合成データで訓練されたモデルを比較し、汎化性能と耐障害性を評価すること。
  • 深層学習ベースのシーケンスモデリングを用いて文字認識を向上させるオープンソースOCRエンジンCalamariを採用すること。
  • 未学習の19世紀のFrakturテキスト(書籍、ジャーナル、辞書を含む)を含むホールドアウトテストセット上で、すべてのモデルを評価すること。
  • OCRエンジン間の性能比較に、文字誤り率(CER)を主な指標として用いること。
  • バイナリ化やノイズ低減などの標準的手法を用いて、OCRエンジンの入力品質を向上させること。

実験結果

リサーチクエスチョン

  • RQ1実際の歴史的Frakturデータに基づいて混合モデルを訓練すると、合成データで訓練した場合に比べて性能が向上するか?
  • RQ2未学習の19世紀のFrakturテキストにおいて、オープンソースOCRエンジンCalamariはTesseract、OCRopus、商業的ABBYシステムと比べてどのように性能を発揮するか?
  • RQ3書籍特有のファインチューニングなしに、オープンソースOCRエンジンが19世紀のFraktur書体でCERを1%未満に抑えることができるか?
  • RQ4訓練データにおけるフォントやタイプセットの多様性が、歴史的書体向けOCRモデルの汎化能力に与える影響は何か?
  • RQ5オープンソースツールが、ABBYのような商業的OCRシステムと同等またはそれを上回る性能を、複雑な歴史的書体認識で達成できるか、その程度はいかほどか?

主な発見

  • 実際の歴史的Frakturデータに基づいて混合モデルを訓練すると、一般化性能と正確性の観点で、合成データで訓練したモデルを著しく上回る。
  • オープンソースOCRエンジンCalamariは、未学習の19世紀のFrakturテキストにおいて平均文字誤り率(CER)が1%未満に達している。
  • テストセット全体にわたり、Calamariは商業的ABBYシステムのCERを平均で70%以上低減している。
  • CalamariはTesseractおよびOCRopusを上回り、複雑な歴史的書体において優れた耐障害性と正確性を示している。
  • 実データ訓練と高度な深層学習アーキテクチャを組み合わせたCalamariは、Fraktur OCR分野で最先端の性能を実現している。
  • 書籍特有のファインチューニングなしでも、最も性能の良いオープンソースモデルは、歴史的Fraktur文書においてほぼプロダクションレベルの正確性を達成している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。