Skip to main content
QUICK REVIEW

[論文レビュー] AutoSTR: Efficient Backbone Search for Scene Text Recognition

Hui Zhang, Quanming Yao|arXiv (Cornell University)|Mar 14, 2020
Handwritten Text Recognition Techniques参考文献 48被引用数 4
ひとこと要約

AutoSTRは、演算子とダウンサンプリングパスの最適化を分離する新しい2段階のニューラルアーキテクチャ探索(NAS)アルゴリズムを用いて、データに依存するバックボーン探索フレームワークを提案する。ドメイン固有の探索空間を設計し、FLOPS正則化を組み込むことで、標準ベンチマークでSOTA手法を上回る性能を示す高効率なバックボーンを発見した。FLOPSとパラメータ数を大幅に削減した。

ABSTRACT

Scene text recognition (STR) is very challenging due to the diversity of text instances and the complexity of scenes. The community has paid increasing attention to boost the performance by improving the pre-processing image module, like rectification and deblurring, or the sequence translator. However, another critical module, i.e., the feature sequence extractor, has not been extensively explored. In this work, inspired by the success of neural architecture search (NAS), which can identify better architectures than human-designed ones, we propose automated STR (AutoSTR) to search data-dependent backbones to boost text recognition performance. First, we design a domain-specific search space for STR, which contains both choices on operations and constraints on the downsampling path. Then, we propose a two-step search algorithm, which decouples operations and downsampling path, for an efficient search in the given space. Experiments demonstrate that, by searching data-dependent backbones, AutoSTR can outperform the state-of-the-art approaches on standard benchmarks with much fewer FLOPS and model parameters.

研究の動機と目的

  • 現在のスポートテキスト認識(STR)では、他のタスクからの事前学習済みバックボーンに依存しているが、その分野に特化したデータ依存のバックボーン設計が不足している問題に対処すること。
  • STRに適したドメイン固有の探索空間を構築し、演算子選択と空間的ダウンサンプリングパスの制約を統合すること。
  • 演算子とダウンサンプリングパスの探索を分離することで、パス制約付き探索空間における従来のNAS手法の限界を克服する効率的な2段階NASアルゴリズムを設計すること。
  • 探索プロセス中にFLOPS正則化を導入することで、モデルの正確性と効率性のバランスを取ること。
  • NASで最適化されたバックボーンが、計算コストを低減しつつSOTAのSTR性能を達成できることを実証すること。

提案手法

  • 畳み込み演算子(例:3×3ディープワイド、MBConv)の選択肢と、ダウンサンプリングパスへの明示的制約を含むドメイン固有の探索空間を提案する。
  • 2段階探索アルゴリズムを導入:まずダウンサンプリングパスを最適化し、次に学習済みパスに条件付けた演算子を最適化する。
  • 従来のNAS手法が効果的に処理できない空間的パス制約を効率的に扱うために、探索問題を分離する。
  • 正確性とモデル複雑度のバランスを取るために、目的関数にFLOPSを正則化項として組み込む。
  • 重み共有メカニズムを用いた微分可能探索戦略を採用し、探索空間内のアーキテクチャを効率的に評価する。
  • 最終的に探索されたアーキテクチャを、標準的なSTRベンチマークで再学習することで性能を検証する。

実験結果

リサーチクエスチョン

  • RQ1NASを用いて発見されたデータ依存のバックボーンは、ResNet や VGG などの固定バックボーンと比較して、スポートテキスト認識の正確性を顕著に向上させることができるか?
  • RQ2演算子とダウンサンプリングパスの探索を分離することは、STRにおけるNASの効率性と有効性にどのように影響するか?
  • RQ3探索中にFLOPS正則化を適用することで、正確性を損なわずにどの程度モデルの複雑度を低減できるか?
  • RQ4画像分類タスクで探索されたNASアーキテクチャを、スポートテキスト認識で効果的に再利用できるか?
  • RQ5ダウンサンプリングパスの選択が、最終的なアーキテクチャの性能に顕著に影響を与えるか?

主な発見

  • AutoSTRは、すべての標準的なSTRベンチマーク(IIIT5K、SVT、IC13、IC15、SVTP)でSOTAの正確性を達成し、IIIT5Kでは94.7%の正確性を記録。ベースラインを0.2%上回った。
  • 探索されたバックボーンは、ベースラインと比較してFLOPSを53%(319Mから149Mに)削減し、パラメータ数も65%(3.82Mから1.32Mに)削減しながら正確性を向上させた。
  • 2段階探索アルゴリズムにより、探索コストが2.2×4 GPU日まで削減され、ランダムサーチ(15×4 GPU日)よりも著しく高速で、より優れた性能を達成した。
  • 画像分類タスクから得たNASアーキテクチャ(DARTS、AutoDeepLab)を直接再利用した場合、性能は著しく劣り(例:IIIT5Kで90.6%)、ドメイン固有の探索が不可欠であることを示した。
  • ABABBのダウンサンプリングパス戦略がIIIT5Kで94.7%の正確性を達成し、AABBB(93.9%)を上回り、パス設計の重要性を裏付けた。
  • β=0.6の正則化が最良のトレードオフを実現し、256M FLOPSと236万パラメータで94.7%の正確性を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。