[論文レビュー] Handwriting recognition using Cohort of LSTM and lexicon verification with extremely large lexicon
本稿では、RimesおよびIAMデータセットにおいて最先端の性能を達成するために、LSTMネットワークのコhortと語彙検証を組み合わせた新しい手書き認識フレームワークを提案する。一度の学習プロセスで数多くの補完的LSTMネットワークを学習し、高速な単語レベルの検証を適用することで、計算コストを最小限に抑えつつ、最大300万語の巨大な語彙を扱える。5,744語の語彙を用いたRimesデータセットではWERが2.28%に低下し、327万語の語彙では8.04%に維持される。
State-of-the-art methods for handwriting recognition are based on Long Short Term Memory (LSTM) recurrent neural networks (RNN), which now provides very impressive character recognition performance. The character recognition is generally coupled with a lexicon driven decoding process which integrates dictionaries. Unfortunately these dictionaries are limited to hundred of thousands words for the best systems, which prevent from having a good language coverage, and therefore limit the global recognition performance. In this article, we propose an alternative to the lexicon driven decoding process based on a lexicon verification process, coupled with an original cascade architecture. The cascade is made of a large number of complementary networks extracted from a single training (called cohort), making the learning process very light. The proposed method achieves new state-of-the art word recognition performance on the Rimes and IAM databases. Dealing with gigantic lexicon of 3 millions words, the methods also demonstrates interesting performance with a fast decision stage.
研究の動機と目的
- 従来の語彙駆動型デコード手法に伴う制限(通常20万語未塔の小さな語彙サイズと高い計算コスト)を克服すること。
- 速度や精度を損なわず、最大300万語の極めて大きな語彙を効率的に扱える認識手法を実現すること。
- ビームサーチを避けるために語彙検証と最小意思決定一致を用いる、高速でスケーラブルな意思決定メカニズムを開発すること。
- 一度の学習ランで多数の補完的LSTMネットワークのコHORTを生成できることを示し、学習のオーバーヘッドを低減すること。
- 標準ベンチマーク(RimesおよびIAM)で最先端の単語認識性能を達成するとともに、低処理時間維持を実現すること。
提案手法
- 複数のLSTMネットワークを一度のモデルから同時に学習するキャスケードアーキテクチャを採用し、重み共有と勾配更新を活用して補完的認識器を生成する。
- 2100個のLSTMネットワークからなるコHORTは、1つの学習プロセスから得られ、学習中に複数のネットワークを効率的に抽出できるという理論的知見を活用している。
- 単語認識の意思決定は語彙検証によって行われる:仮説が語彙内に存在する場合にのみ受け入れられるため、誤検出を顕著に低減する。
- コHORT全体にわたる最小意思決定一致(MNDA)ルールを適用することで、誤受容をさらに低減し、耐障害性を向上させる。
- 処理はキャスケード方式で行われる:一度に1つの単語が検証され、承認されると、以降のネットワークには渡されないため、平均処理時間を短縮する。
- コHORTを2100から118に削減するためのプルーニングを適用し、高い性能を維持しながら平均処理時間を729msから197msに短縮した。
実験結果
リサーチクエスチョン
- RQ1一度の学習ランで、認識性能を向上させる補完的LSTMネットワークのコHORTを大規模に生成できるか?
- RQ2特に巨大な語彙を対象とした場合に、従来のビームサーチベースの語彙駆動型デコード手法と比較して、語彙検証が速度と精度の面で優れているか?
- RQ3語彙が300万語に拡大しても、高い正確性と低処理時間を維持できるか?
- RQ4性能の著しい低下を伴わずに、コHORTをどの程度までプルーニングできるか?
- RQ5提案されたフレームワークは、RimesやIAMといった標準的な手書き認識ベンチマークで最先端の結果を達成できるか?
主な発見
- 5,744語の語彙を用いたRimesデータセットでは、語彙認識率(WRR)が92.96%、語彙誤り率(WER)が2.28%に達し、先行手法を上回る性能を示した。
- 327万語の語彙を用いた場合でも、WERが8.04%を維持し、語彙サイズの拡大に対しても高い耐性を示した。
- 118個のネットワークにプルーニングしたシステムでは、WERが3.64%(完全コHORTでは3.48%)に留まり、処理時間は73%短縮された。
- 処理時間は非常に効率的で、80%の単語が14個目のネットワーク後で0.175秒未塔に処理され、90%が41個目のネットワーク後で0.5秒未塔に処理された。
- 巨大語彙でも1回の検証が1マイクロ秒未塔で実行可能で、スケーラビリティと高速性に優れている。
- 最小限のハイパーパrameterチューニングでRimesおよびIAMデータセットで最先端の性能を達成し、語彙サイズの変動に強く一般化性に優れた性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。