Skip to main content
QUICK REVIEW

[論文レビュー] Vartani Spellcheck -- Automatic Context-Sensitive Spelling Correction of OCR-generated Hindi Text Using BERT and Levenshtein Distance

Aditya Pal, Abhijit Mustafi|arXiv (Cornell University)|Dec 14, 2020
Natural Language Processing Techniques参考文献 8被引用数 5
ひとこと要約

Vartani Spellcheck は、BERT埋め込みと Levenshtein 距離を用いて、OCR で生成されたヒンディー語テキスト向けの文脈に敏感な綴りの誤り訂正システムを提案する。照合辞書、固有表現抽出、文脈的埋め込みを組み合わせることで、Tesseract-OCR で処理された『ラーマヤナ』テキストにおいて 81% の正確性を達成し、従来の文脈フリーな手法を著しく上回る。

ABSTRACT

Traditional Optical Character Recognition (OCR) systems that generate text of highly inflectional Indic languages like Hindi tend to suffer from poor accuracy due to a wide alphabet set, compound characters and difficulty in segmenting characters in a word. Automatic spelling error detection and context-sensitive error correction can be used to improve accuracy by post-processing the text generated by these OCR systems. A majority of previously developed language models for error correction of Hindi spelling have been context-free. In this paper, we present Vartani Spellcheck - a context-sensitive approach for spelling correction of Hindi text using a state-of-the-art transformer - BERT in conjunction with the Levenshtein distance algorithm, popularly known as Edit Distance. We use a lookup dictionary and context-based named entity recognition (NER) for detection of possible spelling errors in the text. Our proposed technique has been tested on a large corpus of text generated by the widely used Tesseract OCR on the Hindi epic Ramayana. With an accuracy of 81%, the results show a significant improvement over some of the previously established context-sensitive error correction mechanisms for Hindi. We also explain how Vartani Spellcheck may be used for on-the-fly autocorrect suggestion during continuous typing in a text editor environment.

研究の動機と目的

  • 複雑な script と文字分離の問題により、ヒンディー語のような変化が著しいインディック言語の OCR 輸出における正確性の低さを是正すること。
  • 従来の文脈フリーなモデルを凌駕する、文脈に応じた綴りの誤り訂正システムを構築すること。
  • 特に BERT と Levenshtein 距離を含む最新の NLP 技術を、ヒンディー語向けの実用的訂正パイプラインに統合すること。
  • 提案された訂正フレームワークを活用して、テキストエディタでのリアルタイムの自動訂正提案を可能にすること。
  • Tesseract OCR で処理された大規模で現実世界のヒンディー語テキスト(『ラーマヤナ』)のデータセット上でシステムを検証すること。

提案手法

  • システムは照合辞書を用いて、OCR で生成されたヒンディー語テキスト内の潜在的な綴りの誤りを特定する。
  • 固有表現抽出(NER)を適用して、文脈的に関連する用語で誤って綴られた可能性があるものを検出する。
  • BERT 埋め込みを用いて、単語の文脈的表現を捉え、文脈に応じた訂正意思決定を可能にする。
  • 候補となる訂正語と元の語との間で Levenshtein 距離(編集距離)を計算し、妥当な訂正語をランク付けする。
  • 照合辞書または NER で特定された語に一致する BERT 埋め込み候補の中で、最小の編集距離を持つ語を最終的な訂正語として選択する。
  • パイプラインは、リアルタイムのテキスト編集環境における即時の自動訂正をサポートするように設計されている。

実験結果

リサーチクエスチョン

  • RQ1文脈に敏感な綴りの誤り訂正システムは、文脈フリーな手法と比較して、OCR で生成されたヒンディー語テキストの正確性を著しく向上させることができるか?
  • RQ2BERT 埋め込みと Levenshtein 距離の統合は、OCR 輸出におけるヒンディー語の綴りの誤りの検出および訂正にどの程度効果的か?
  • RQ3固有表現抽出と照合辞書照合は、ヒンディー語のような低リソースで屈曲が著しい言語における誤り検出をどの程度向上させられるか?
  • RQ4提案されたシステムは、テキストエディタでのリアルタイムで相互作用的な自動訂正に適応可能か?
  • RQ5『ラーマヤナ』のような大規模で現実世界のヒンディー語テキストコーパスにおける、このシステムのパフォーマンスはいかほどか?

主な発見

  • 提案された Vartani Spellcheck システムは、Tesseract-OCR で処理された『ラーマヤナ』のヒンディー語テキストの大規模コーパスにおいて 81% の正確性を達成した。
  • BERT と Levenshtein 距離を用いた文脈に敏感なアプローチは、ヒンディー語における従来の文脈フリーな誤り訂正メカニズムを上回った。
  • 固有表現抽出と照合辞書照合の統合は、構文的に複雑なテキストにおける潜在的な綴りの誤り検出を著しく向上させた。
  • システムはリアルタイム応用の実現可能性を示し、継続的な入力中に即時の自動訂正提案を可能にした。
  • 文脈的埋め込みと編集距離の組み合わせは、低リソースで高頻度の屈曲性を持つ環境において、単独で用いるよりも優れた訂正品質をもたらすことが確認された。
  • この手法は大規模でドメイン特化したコーパスでも頑健であることが示され、インド系言語 NLP における広範な応用可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。