Skip to main content
QUICK REVIEW

[論文レビュー] Handwritten Mathematical Expression Recognition with Bidirectionally Trained Transformer

Wenqi Zhao, Liangcai Gao|arXiv (Cornell University)|May 6, 2021
Handwritten Text Recognition Techniques参考文献 44被引用数 7
ひとこと要約

本論文は、RNNベースのデコーダーに代わってトランスフォーマー・デコーダーを採用し、双方向言語モデル学習を可能にするための新しいトレーニング戦略を導入することで、手書き数式認識のための双方向に学習されたトランスフォーマー(BTTR)モデルを提案する。この手法は、データ拡張を用いない状態でも、CROHME 2014で2.23%、CROHME 2016で1.92%、CROHME 2019で2.28%の精度向上を達成し、最先端の性能を実現した。

ABSTRACT

Encoder-decoder models have made great progress on handwritten mathematical expression recognition recently. However, it is still a challenge for existing methods to assign attention to image features accurately. Moreover, those encoder-decoder models usually adopt RNN-based models in their decoder part, which makes them inefficient in processing long $\LaTeX{}$ sequences. In this paper, a transformer-based decoder is employed to replace RNN-based ones, which makes the whole model architecture very concise. Furthermore, a novel training strategy is introduced to fully exploit the potential of the transformer in bidirectional language modeling. Compared to several methods that do not use data augmentation, experiments demonstrate that our model improves the ExpRate of current state-of-the-art methods on CROHME 2014 by 2.23%. Similarly, on CROHME 2016 and CROHME 2019, we improve the ExpRate by 1.92% and 2.28% respectively.

研究の動機と目的

  • 長距離依存性のモデリングが不十分であるため、モデルが記号を過小または過剰に予測してしまうHMERにおけるカバレッジ問題を解消する。
  • 長大なLaTeXシーケンスを処理する際、RNNベースのデコーダーの非効率さと逐次的性質を克服する。
  • 1つのトランスフォーマー・デコーダーが左から右および右から左の両方のデコードを実行することで、構文的認識の向上を図る。
  • 画像と単語の位置エンコーディングを併用することで、モデルの汎化性能と精度を向上させる。
  • データ拡張技術に依存せずに、CROHMEベンチマークで最先端の性能を達成する。

提案手法

  • RNNベースのデコーダーをトランスフォーマー・デコーダーに置き換えることで、並列学習が可能になり、長距離依存性のモデリングが向上する。
  • 入力特徴マップの特定の領域に注目を向けるために、画像位置エンコーディング(IPE)を導入し、空間的局在化を改善する。
  • 1つのトランスフォーマー・デコーダー内で左から右および右から左のデコードを同時に最適化する双方向トレーニング戦略を提案する。
  • 近似的な共同探索(AJS)を活用し、両方向からの予測を再スコアリングすることで、出力のバランスと構文的正しさを向上させる。
  • 5つの独立して初期化されたモデルの予測を平均化することで、アンサンブル技術を適用し、さらなる性能向上を図る。
  • スケジューリング・サンプリングを用いたクロスエントロピー損失でエンドツーエンドに学習を行い、自己注意機構の置換不変性を活用して双方向学習を実現する。

実験結果

リサーチクエスチョン

  • RQ1モデルの複雑さを増さずに、1つのトランスフォーマー・デコーダーがHMERにおける双方向言語モデル学習を効果的に学習できるか。
  • RQ2画像位置エンコーディングの統合により、注目メカニズムの整合性が向上し、HMERにおける過剰・不足解析の問題が軽減されるか。
  • RQ3双方向学習は一方向学習と比較して、認識精度および構文的正しさの観点でどのように優れているか。
  • RQ4近似的な共同探索(AJS)は、長大なLaTeXシーケンスにおける予測のバランスと精度をどの程度向上させるか。
  • RQ5提案されたBTTRモデルは、データ拡張に依存せずに、標準的なCROHMEベンチマークで最先端の性能を達成できるか。

主な発見

  • BTTRモデルは、CROHME 2014のテストセットで57.91%のExpRateを達成し、データ拡張を用いない状態で最先端性能を2.23%上回った。
  • CROHME 2016では、54.49%のExpRateを達成し、先行手法より1.92%の向上を示した。
  • CROHME 2019では、56.88%のExpRateを達成し、現在の最先端性能に対して2.28%の相対的向上を達成した。
  • アブレーションスタディの結果、画像位置エンコーディングが、特に多様なスケールにおいて一般化性能を向上させることを確認した。
  • 双方向トレーニング戦略は、L2Rデコードのみを用いても、一方向学習と比較して2.52%の性能向上をもたらした。
  • 近似的な共同探索とモデルアンサンブルの活用により、それぞれExpRateが4.68%および3.35%向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。