Skip to main content
QUICK REVIEW

[論文レビュー] Scene Text Recognition with Permuted Autoregressive Sequence Models

Darwin Bautista, Rowel Atienza|arXiv (Cornell University)|Jul 14, 2022
Handwritten Text Recognition Techniques被引用数 8
ひとこと要約

PARSeqは、共有重みと双方向的文脈を用いて画像特徴量と言語特徴量を統合的に処理する、統一的で入れ替えられた自己回帰的系列モデルを提案する。これにより、状態性能を達成(合成データで91.9%、実データで96.0%)、効率性が向上し、任意のテキスト方向に対して耐性があり、誤った予測の補正に依存する外部言語モデルの必要性が低減される。

ABSTRACT

Context-aware STR methods typically use internal autoregressive (AR) language models (LM). Inherent limitations of AR models motivated two-stage methods which employ an external LM. The conditional independence of the external LM on the input image may cause it to erroneously rectify correct predictions, leading to significant inefficiencies. Our method, PARSeq, learns an ensemble of internal AR LMs with shared weights using Permutation Language Modeling. It unifies context-free non-AR and context-aware AR inference, and iterative refinement using bidirectional context. Using synthetic training data, PARSeq achieves state-of-the-art (SOTA) results in STR benchmarks (91.9% accuracy) and more challenging datasets. It establishes new SOTA results (96.0% accuracy) when trained on real data. PARSeq is optimal on accuracy vs parameter count, FLOPS, and latency because of its simple, unified structure and parallel token processing. Due to its extensive use of attention, it is robust on arbitrarily-oriented text which is common in real-world images. Code, pretrained weights, and data are available at: https://github.com/baudm/parseq.

研究の動機と目的

  • 自己回帰的言語モデルがシーンテキスト認識において抱える限界、すなわち一方向の文脈バイアスと外部言語モデルを用いた非効率な二段階推論を解消すること。
  • 文脈フリーの非自己回帰的モデルと文脈ありの自己回帰的モデルを統合し、単一で効率的なモデルアーキテクチャを構築すること。
  • 現実世界の画像に一般的に見られる任意の方向や歪みを伴うテキストに対して、耐性を高めること。
  • 外部言語モデルによる正しい予測の誤った補正を回避するため、画像と文脈を統合的にモデリングすること。
  • 並列トークン処理と効率的なアテンション機構を用いて、最小限の計算コストと低遅延で最先端の性能を達成すること。

提案手法

  • PARSeqは、共有重みを用いた入れ替えられた自己回帰的言語モデルのアンサンブルを学習することで、1回のフォワードパスで双方向的文脈を学習可能にする。
  • 視覚的特徴量と予測トークンを同時に注目できるクロスモodalアテンションを備えたトランスフォーマー基盤のアーキテクチャを採用し、予測の反復的改善を可能にする。
  • 初期デコードと反復的改善を統合的に処理することで、文脈フリーと文脈ありの別々のモデルを必要としない。
  • 入れ替えられた自己回帰的モデリングにより、強力な自己回帰的インダクティブバイアスを維持しながら並列的なトークン生成が可能となり、従来の自己回帰的デコードに比べて遅延が低減される。
  • 自己アテンション機構を活用して長距離依存関係をモデル化でき、アテンションに基づく特徴統合のおかげでテキストの向きの変化に対しても耐性がある。
  • 一般化を向上させるために合成データで学習を行い、実データで微調整することで、現実世界のベンチマークで高い精度を達成する。

実験結果

リサーチクエスチョン

  • RQ1文脈フリーと文脈ありのモデルを分離した二段階パイプラインに代わって、統一されたモデルアーキテクチャが認識精度と効率性を向上させることができるか?
  • RQ2共有重みを用いた入れ替えられた自己回帰的モデリングは、標準的な自己回帰的モデルと比較して、任意の方向や歪みを伴うテキストに対してどのように耐性を高めるか?
  • RQ3内部言語モデリングは、外部言語モデルと比較して、正しい予測の誤った補正のリスクをどの程度低減できるか?
  • RQ41回の統合的推論パスで入れ替えられたモデリングによる双方向的文脈を活用することで、どの程度の性能向上が得られるか?
  • RQ5合成データで学習したモデルが、実データで微調整することで、現実世界のシーンテキストベンチマークで最先端の結果を達成できるか?

主な発見

  • PARSeqは、合成データベンチマークで91.9%という新たな最先端精度を達成し、先行手法を上回る。
  • 実世界データでは96.0%の精度を達成し、Uber-TextやCOCO-Textを含む複数のベンチマークで新たなSOTAを樹立した。
  • PARSeqは、他のモデルが失敗する高角度回転や垂直方向のテキストを含む、Uber-Textデータセットのすべてのサンプルを正しく認識した。
  • 定性的な比較において、PARSeqは唯一、部分的に隠れたりした文字を含む「Chevron」や、低解像度・隠れたりした文字を含む「GUNNESS」のような困難なサンプルを正しく認識した。
  • カーブや草書体のテキスト(例:草書体の「Creative」)においても、ABINet や ViTSTR-S が正しく文字列を認識できないのに対し、PARSeqは優れた性能を示した。
  • 統一的かつ並列処理可能なアーキテクチャと効率的なアテンション機構のおかげで、精度、パラメータ数、FLOPS、遅延の最適なトレードオフを達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。