Skip to main content
QUICK REVIEW

[論文レビュー] A Multi-Object Rectified Attention Network for Scene Text Recognition

Canjie Luo, Lianwen Jin|arXiv (Cornell University)|Jan 10, 2019
Handwritten Text Recognition Techniques参考文献 55被引用数 12
ひとこと要約

本稿では、不規則で歪んだテキストを読みやすく水平に整列した形に変換するマルチオブジェクト補正ネットワーク(MORN)と、注意メカニズムに基づくシーケンス認識ネットワーク(ASRN)を組み合わせた、シーンテキスト認識のためのマルチオブジェクト補正注意ネットワーク(MORAN)を提案する。弱い教師付き学習(画像-テキストペアのみ)で訓練されたMORANは、複数のベンチマークで最先端の性能を達成しており、特にSVT-Perspective や CUTE80 のような困難な不規則テキストデータセットにおいて、透視図法的変形、曲がり、スケール変化に対して高い頑健性を示している。

ABSTRACT

Irregular text is widely used. However, it is considerably difficult to recognize because of its various shapes and distorted patterns. In this paper, we thus propose a multi-object rectified attention network (MORAN) for general scene text recognition. The MORAN consists of a multi-object rectification network and an attention-based sequence recognition network. The multi-object rectification network is designed for rectifying images that contain irregular text. It decreases the difficulty of recognition and enables the attention-based sequence recognition network to more easily read irregular text. It is trained in a weak supervision way, thus requiring only images and corresponding text labels. The attention-based sequence recognition network focuses on target characters and sequentially outputs the predictions. Moreover, to improve the sensitivity of the attention-based sequence recognition network, a fractional pickup method is proposed for an attention-based decoder in the training phase. With the rectification mechanism, the MORAN can read both regular and irregular scene text. Extensive experiments on various benchmarks are conducted, which show that the MORAN achieves state-of-the-art performance. The source code is available.

研究の動機と目的

  • 透視図法的変形、曲がり、回転などの複雑な歪みを伴う不規則なシーンテキストを認識する課題に対処すること。
  • 幾何的またはピxlsレベルの教師信号を必要としない弱い教師付きアプローチを用いて、不規則なテキストをより読みやすく補正された形に変換することで認識の難易度を低下させること。
  • 分数量り取り法を用いて文脈の感度を向上させることで、注意メカニズムに基づくシーケンス認識の性能を向上させること。
  • カリキュラム学習を用いて、補正と認識の統合フレームワークをエンドツーエンドで訓練できること。
  • 幾何的制約なしに多様なテキスト変形に一般化可能な柔軟な、幾何フリーな補正メカニズムを構築すること。

提案手法

  • MORANフレームワークは、座標グリッドからオフセットグリッドを予測することで、空間的変換を可能にするマルチオブジェクト補正ネットワーク(MORN)から構成される。これにより、不規則なテキストがより水平でタイトな境界に整列する。
  • MORNは、幾何的またはピxlsレベルの教師信号を必要とせず、画像とテキストラベルのみを用いて弱い教師付きで学習される。
  • 注意メカニズムに基づくシーケンス認識ネットワーク(ASRN)は、補正済み画像を処理し、関連する特徴領域に注目することで文字列を生成する。
  • 訓練中に分数量り取り法が導入され、複数スケールで特徴マップをランダムに伸長することで、受容 field を拡大し、文脈的変化に対する頑健性を向上させる。
  • カリキュラム学習戦略が採用され、最初に1つのサブネットワーク(MORN または ASRN)を固定して他方を最適化した後、最終的に両方を共同で微調整する。
  • 微分可能で空間変換器に類似したメカニズムを用いることで、補正プロセスを介した勾配の誤差逆伝播が可能となり、エンドツーエンドの訓練が可能になる。

実験結果

リサーチクエスチョン

  • RQ1幾何的教師信号を一切必要としない弱い教師付き補正ネットワークは、透視図法的変形や曲がりといった複雑なテキスト歪みを効果的に処理できるか?
  • RQ2分数量り取り法は、シーケンス認識における注意メカニズムの感度と頑健性をどのように向上させるか?
  • RQ3補正と認識の統合的トレーニングは、独立したモデルと比較して、不規則なシーンテキスト認識性能をどの程度向上させるか?
  • RQ4MORANフレームワークは、低解像度や曲がったテキストを含む、挑戦的なテキスト変化を伴うベンチマークでどの程度の性能を示すか?
  • RQ5提案手法は、任意の形状や複雑な背景を有する実世界のシーンテキストにも一般化可能か?

主な発見

  • MORANは、IIIT5K、SVT、ICDAR2003、ICDAR2013、ICDAR2015、SVT-Perspective、CUTE80 など、複数のベンチマークで最先端の性能を達成している。
  • SVT-Perspective データセットでは、語彙辞書を一切使用しない状態でも、50語の語彙辞書を用いた場合に87.6%、使用しない場合に85.2%の語彙精度を達成し、すべてのベースラインを上回った。
  • CUTE80 における定性的な結果から、わずかな曲がり角を持つ曲がったテキストの補正に成功しており、多数の曲がったインスタンスが正しく認識されている。
  • 分数量り取り法は、注意デコーダーの頑健性を顕著に向上させ、シーケンス予測時のより良いアライメントと文脈モデリングを可能にした。
  • カリキュラム学習戦略により、MORN と ASRN を段階的に最適化した後、エンドツーエンド微調整を行うことで、トレーニングの安定性と最終的な性能が向上した。
  • 非常に大きな曲がり角や複雑な背景の処理には限界があるものの、クロップされ水平に整列した不規則なテキストに対しては強力な一般化性能を示しており、標準的なベンチマークでは失敗事例は稀であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。