Skip to main content
QUICK REVIEW

[論文レビュー] A Novel Approach to OCR using Image Recognition based Classification for Ancient Tamil Inscriptions in Temples

Lalitha Giridhar, Aishwarya Dharani and|arXiv (Cornell University)|Jul 4, 2019
Handwritten Text Recognition Techniques被引用数 15
ひとこと要約

本論文は、7世紀〜12世紀の古代タミル碑文を対象とした、手動で校正されたクロップ済み寺院碑文画像でトレーニングされた2次元畳み込みニューラルネットワーク(2D-CNN)を用いた新規OCRシステムを提案する。Otsu法に基づく二値化処理を経て、CNNが文字を分類し、結果は pytesseract と TTS 出力と統合される。このシステムはテストセットで77.7%の認識精度を達成した。

ABSTRACT

Recognition of ancient Tamil characters has always been a challenge for epigraphers. This is primarily because the language has evolved over the several centuries and the character set over this time has both expanded and diversified. This proposed work focuses on improving optical character recognition techniques for ancient Tamil script which was in use between the 7th and 12th centuries. While comprehensively curating a functional data set for ancient Tamil characters is an arduous task, in this work, a data set has been curated using cropped images of characters found on certain temple inscriptions, specific to this time as a case study. After using Otsu thresholding method for binarization of the image a two dimensional convolution neural network is defined and used to train, classify and, recognize the ancient Tamil characters. To implement the optical character recognition techniques, the neural network is linked to the Tesseract using the pytesseract library of Python. As an added feature, the work also incorporates Google's text to speech voice engine to produce an audio output of the digitized text. Various samples for both modern and ancient Tamil were collected and passed through the system. It is found that for Tamil inscriptions studied over the considered time period, a combined efficiency of 77.7 percent can be achieved.

研究の動機と目的

  • 数世紀にわたり顕著に変化を遂げた古代タミル文字を認識する課題に取り組むこと。これは、標準化されたデジタルリソースが不足しているためである。
  • 7世紀から12世紀にかけての寺院碑文から抽出したクロップ済み文字の実用的データセットを構築すること。
  • 深層学習に基づく画像分類を用いて、歴史的タミル文字のOCRパフォーマンスを向上させること。
  • デジタイズされた碑文のアクセシブルな出力のため、テキストから音声への変換(TTS)機能を統合すること。
  • 現代および古代タミルテキストの両方のサンプルに対して、システムのパフォーマンスを評価すること。

提案手法

  • 7世紀から12世紀にかけての寺院碑文から抽出した古代タミル文字のクロップ画像から、独自のデータセットを収集した。
  • コントラストを向上させ、分類処理に適した状態に整えるために、Otsuのしきい値処理法を用いて画像の二値化を実施した。
  • 個々のタミル文字を分類する目的で、2次元畳み込みニューラルネットワーク(2D-CNN)を設計・トレーニングした。
  • トレーニング済みのCNNモデルを、pytesseract Pythonライブラリを介してTesseract OCRエンジンとインターフェース接続し、エンドツーエンドのOCR処理を実現した。
  • Googleのテキストから音声への変換エンジンを統合し、認識されたテキストから音声出力を生成した。
  • 認識精度の評価を、現代および古代タミルテキストの両方のサンプルに対して実施した。

実験結果

リサーチクエスチョン

  • RQ1深層学習に基づく画像分類モデルは、歴史的碑文からの古代タミル文字を信頼性を持って認識できるか?
  • RQ2Otsuに基づく画像前処理は、劣化した寺院碑文の文字認識精度を向上させるのにどの程度有効か?
  • RQ32D-CNN分類とTesseractを統合したハイブリッドOCRシステムは、古代タミル書体に対してどの程度のパフォーマンスを示すか?
  • RQ47世紀〜12世紀にかけての異なる碑文における書体やフォントの多様性に対して、このシステムはどの程度の耐性を示すか?
  • RQ5テキストから音声への変換の統合は、碑文研究および文化的保存の分野におけるアクセシビリティをどの程度向上させるか?

主な発見

  • 提案されたOCRシステムは、7世紀〜12世紀の古代タミル碑文に対して、合計77.7%の認識精度を達成した。
  • Otsuしきい値処理は、コントラストの向上とノイズの低減により、その後続のCNN分類処理のための画像品質を顕著に向上させた。
  • pytesseractを介した2D-CNNとTesseractの統合により、効果的なエンドツーエンドのテキスト認識が実現された。
  • GoogleのTTSエンジンを用いて、デジタイズされた碑文の音声出力を成功裏に生成し、マルチモーダルなアクセスを可能にした。
  • 寺院碑文から収集したクロップ済み文字のデータセットは、歴史的書体データのラベル付きデータが不足している中でも、トレーニングおよび評価に有効であることが示された。
  • 本手法は、歴史的変化が著しい書体のための大規模な碑文デジタイゼーションに実用的であると示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。