[論文レビュー] Tamizhi-Net OCR: Creating A Quality Large Scale Tamil-Sinhala-English Parallel Corpus Using Deep Learning Based Printed Character Recognition (PCR).
本稿では、レガシーフォントで印刷されたテキストを対象とした、LSTMベースの学習を用いたTesseract 4.1.1モデルを強化したTamizhi-Net OCRを提案する。この手法により、タミル語、僧伽羅語、英語の印刷文字認識(PCR)が向上し、タミル語では98.2%(相対改善率+12.9%)、僧伽羅語では94.8%(相対改善率+3.26%)の文字単位の正確性を達成。非標準フォントを含むPDFから、スケーラブルかつ自動的に多言語テキストを抽出可能である。
Most of the low resource languages do not have the necessary resources to create even a substantial monolingual corpus. These languages may often be found in government proceedings but mostly in the form of Portable Document Formats (PDFs) that contains legacy fonts. Extracting text from these documents to create a monolingual corpus is challenging due to legacy font usage and printer-friendly encoding which are not optimized for text extraction. Therefore, we propose a simple, automatic, and novel idea that can scale for Tamil, Sinhala, and English languages and many documents. For this purpose, we enhanced the performance of Tesseract 4.1.1 by employing LSTM-based training on many legacy fonts to recognize printed characters in the above languages. Especially, our model detects code-mix text, numbers, and special characters from the printed document. It is shown that this approach can boost the character-level accuracy of Tesseract 4.1.1 from 85.5 to 98.2 for Tamil (+12.9% relative change) and 91.8 to 94.8 for Sinhala (+3.26% relative change) on a dataset that is considered as challenging by its authors.
研究の動機と目的
- タミル語や僧伽羅語のような低リソース言語向けに、大規模かつ高品質な単一言語コーパスが不足している問題に対処すること。
- 古式フォントやプリンタフレンドリーなエンコードを用いたPDFからテキストを抽出する際の課題を克服すること。
- 混合言語(コードミックス)文書におけるタミル語、僧伽羅語、英語の印刷文字を自動的かつスケーラブルに認識する手法を開発すること。
- レガシーフォントデータを用いたディープラーニングにより、Tesseract 4.1.1のこれらの言語における文字単位の正確性を向上させること。
- スキャンされた、非標準フォントを含むPDFから、並列して作成されたタミル語-僧伽羅語-英語コーパスを生成可能にする仕組みを構築すること。
提案手法
- 多様なレガシーフォントで学習されたLSTMベースの光学的文字認識(OCR)モデルを用いて、Tesseract 4.1.1を強化した。
- 印刷されたタミル語、僧伽羅語、英語の文字を含む大規模なマルチリンガルデータセットを用いてモデルを学習した。このデータセットには、コードミックステキスト、数字、特殊文字も含まれている。
- 非ラテン文字や複雑な文字セットを持つスクリプトを認識できるように、Tesseractの既存アーキテクチャを適応させるためのトランスファー学習技術を適用した。
- 政府文書に一般的に見られるプリンタフレンドリーなエンコードや非標準フォントマッピングに対応するため、モデルを最適化した。
- 一般化性能を向上させるために、独自のデータパイプラインを用いて、レガシーフォントPDFをトレーニングサンプルに変換・拡張した。
- 文字単位の正確性向上を測定するために、挑戦的なベンチマークデータセットを用いて性能を評価した。
実験結果
リサーチクエスチョン
- RQ1LSTM強化Tesseract 4.1.1は、古式フォントを含む文書において、タミル語および僧伽羅語の文字単位正確性を顕著に向上させることができるか?
- RQ2このモデルは、マルチリンガル印刷文書において、コードミックステキスト、数字、特殊文字をどの程度正確に検出・認識できるか?
- RQ3本手法は、低リソース言語の政府文書やアーカイブ文書の大規模な処理に対して、どの程度スケーラブルか?
- RQ4Tesseract 4.1.1のベースラインと比較して、タミル語および僧伽羅語のOCR正確性にどの程度の相対的改善が見られるか?
- RQ5このアプローチにより、スキャンされた文書から高品質な並列タミル語-僧伽羅語-英語コーパスを自動的に作成可能か?
主な発見
- 提案されたTamizhi-Net OCRモデルは、挑戦的なベンチマークデータセットにおいて、タミル語の文字単位正確性を85.5%から98.2%まで向上させ、相対改善率12.9%を達成した。
- 僧伽羅語では、94.8%の文字単位正確性を達成し、ベースラインのTesseract 4.1.1(91.8%)と比較して3.26%の相対的改善を示した。
- モデルは、マルチリンガル印刷文書において、コードミックステキスト、数字、特殊文字を高い忠実度で正しく認識できた。
- 本手法は、政府機関やアーカイブリポジトリに一般的に見られる大規模なレガシーフォントPDFの処理に対してもスケーラブルであることが示された。
- 強化されたTesseractモデルにより、スキャンされた非標準フォーマットの文書から、高品質な単一言語および並列コーパスを自動生成可能となった。
- 結果から、タミル語や僧伽羅語のような低リソーススクリプトにおいて、レガシーフォントデータを用いたLSTMベースのファインチューニングがOCR性能を顕著に向上させることを確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。