Skip to main content
QUICK REVIEW

[論文レビュー] Pattern Generation Strategies for Improving Recognition of Handwritten Mathematical Expressions

Anh Duc Le, Bipin Indurkhya|arXiv (Cornell University)|Jan 21, 2019
Handwritten Text Recognition Techniques参考文献 14被引用数 5
ひとこと要約

本稿では、限られた学習データを用いた手書き数式(HME)認識の性能向上を目的として、パターン生成戦略を提案する。局所的・全域的歪みおよびオンラインHMEの構造的分解を適用することで、著者らは合成データを生成し、エンドツーエンドのディーブラーニングシステムにおける性能向上を実現した。CROHME 2014および2016では、それぞれ48.78%および45.60%の分類率を達成し、小規模データセットでも既存手法を上回った。

ABSTRACT

Recognition of Handwritten Mathematical Expressions (HMEs) is a challenging problem because of the ambiguity and complexity of two-dimensional handwriting. Moreover, the lack of large training data is a serious issue, especially for academic recognition systems. In this paper, we propose pattern generation strategies that generate shape and structural variations to improve the performance of recognition systems based on a small training set. For data generation, we employ the public databases: CROHME 2014 and 2016 of online HMEs. The first strategy employs local and global distortions to generate shape variations. The second strategy decomposes an online HME into sub-online HMEs to get more structural variations. The hybrid strategy combines both these strategies to maximize shape and structural variations. The generated online HMEs are converted to images for offline HME recognition. We tested our strategies in an end-to-end recognition system constructed from a recent deep learning model: Convolutional Neural Network and attention-based encoder-decoder. The results of experiments on the CROHME 2014 and 2016 databases demonstrate the superiority and effectiveness of our strategies: our hybrid strategy achieved classification rates of 48.78% and 45.60%, respectively, on these databases. These results are competitive compared to others reported in recent literature. Our generated datasets are openly available for research community and constitute a useful resource for the HME recognition research in future.

研究の動機と目的

  • 手書き数式(HME)認識システムにおけるアノテート済み学習データの不足という課題に対処すること。
  • 合成データ生成を活用して、データが少ない状況下での認識性能を向上させること。
  • 形状および構造的多様性を向上させるためのパターン生成戦略の開発と評価すること。
  • 将来のHME研究のための公開可能で高品質な合成データセットの作成すること。
  • ハイブリッドデータ拡張戦略がエンドツーエンドのディーブラーニング認識システムにおいて有効であるかを検証すること。

提案手法

  • 著者らは、CROHME 2014および2016データセットのオンラインHMEに対して局所的および全域的歪みを適用し、形状の変異を生成した。
  • 完全なオンラインHMEを部分的なオンラインHMEに分解することで、構造的変異を生成した。
  • 歪みベースと分解ベースの両方の生成戦略を組み合わせたハイブリッド戦略を採用し、多様性を最大化した。
  • 生成されたオンラインHMEは、オフライン認識評価のため画像形式に変換された。
  • CNNとアテンションベースのエンコーダデコーダを組み合わせたエンドツーエンド認識システムを用いて、性能を評価した。
  • 本手法は、合成データ作成の基盤として、公開されているCROHMEデータセットを活用した。

実験結果

リサーチクエスチョン

  • RQ1限られた学習データにおいて、合成データ生成が手書き数式認識の精度向上に寄与するか?
  • RQ2局所的および全域的歪みは、HMEの形状変異を生成するためにどの程度有効か?
  • RQ3HMEの構造的分解は、認識性能の向上にどの程度寄与するか?
  • RQ4形状と構造的変異の両方を生成する戦略を組み合わせることで、個別戦略に比べて優れた結果が得られるか?
  • RQ5生成された合成データセットは、将来のHME研究のための実用的リソースとして有効であるか?

主な発見

  • ハイブリッドパターン生成戦略は、CROHME 2014データセットで48.78%の分類率を達成し、優れた性能を示した。
  • CROHME 2016データセットでは、ハイブリッド戦略が45.60%の分類率に達し、一貫した改善が確認された。
  • 限られたデータ環境下でも、提案されたデータ生成戦略はベースライン手法を顕著に上回った。
  • 生成された合成データセットは公開されており、将来のHME研究にとって貴重なリソースとなった。
  • 形状と構造的変異の両方をハイブリッド生成で組み合わせることで、最高の認識結果が得られた。
  • エンドツーエンドのディーブラーニングシステムは、拡張されたデータを効果的に活用でき、本手法のスケーラビリティとロバスト性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。