Skip to main content
QUICK REVIEW

[論文レビュー] FAST: Faster Arbitrarily-Shaped Text Detector with Minimalist Kernel Representation

Zhe Chen, Wang, Jiahao|arXiv (Cornell University)|Nov 3, 2021
Handwritten Text Recognition Techniques参考文献 46被引用数 7
ひとこと要約

FAST は、ミニマルなカーネル表現(MKR)と GPU 並列後処理を用いたリアルタイムで高精度な任意形状テキスト検出器を提案する。Total-Text において 152.8 FPS で 81.6% の F-スコアを達成し、速度と精度の両面で従来手法を上回る。本手法は、テキスト固有のバックボーン(TextNet)を設計するためのカスタムニューラルアーキテクチャサーチ(NAS)を採用し、最小限の後処理オーバーヘッドで効率的なエンドツーエンド GPU 推論を実現する。

ABSTRACT

We propose an accurate and efficient scene text detection framework, termed FAST (i.e., faster arbitrarily-shaped text detector). Different from recent advanced text detectors that used complicated post-processing and hand-crafted network architectures, resulting in low inference speed, FAST has two new designs. (1) We design a minimalist kernel representation (only has 1-channel output) to model text with arbitrary shape, as well as a GPU-parallel post-processing to efficiently assemble text lines with a negligible time overhead. (2) We search the network architecture tailored for text detection, leading to more powerful features than most networks that are searched for image classification. Benefiting from these two designs, FAST achieves an excellent trade-off between accuracy and efficiency on several challenging datasets, including Total Text, CTW1500, ICDAR 2015, and MSRA-TD500. For example, FAST-T yields 81.6% F-measure at 152 FPS on Total-Text, outperforming the previous fastest method by 1.7 points and 70 FPS in terms of accuracy and speed. With TensorRT optimization, the inference speed can be further accelerated to over 600 FPS. Code and models will be released at https://github.com/czczup/FAST.

研究の動機と目的

  • 従来のテキスト検出器における CPU による後処理の非効率性(推論時間の最大 30% を占める)を解消すること。
  • リアルタイム推論を可能にするため、並列処理が可能な GPU 友好的なテキスト表現を設計すること。
  • 画像分類とは異なり、テキスト検出に特化したニューラルアーキテクチャサーチ(NAS)パイプラインを構築し、より効果的な軽量バックボーンを発見すること。
  • 困難な任意形状テキストベンチマークにおいて、検出精度と推論速度の優れたトレードオフを達成すること。

提案手法

  • テキストラインを1チャネルのエロージョン領域と周辺ピクセルで表現するミニマルなカーネル表現(MKR)を導入し、後処理段階での GPU 並列テキスト拡張を効率的に行えるようにする。
  • MKR 出力から完全なテキストインスタンスを再構築するための GPU 並列テキスト拡張処理を採用し、後処理時間を無視できる程度にまで短縮する。
  • テキスト検出に特化したカスタム NAS の探索空間と報酬関数を設計し、一般画像分類とは異なり、テキストに特化したコンテキストにおける特徴品質を最適化する。
  • 効率的なバックボーンである TextNet を探索・導入し、ImageNet ファンダメンタルや一般物体検出モデルよりもテキスト検出に適していることを実証する。
  • TensorRT を用いた推論最適化により、V100 GPU でバッチサイズ 8 時に 600 FPS を超える推論速度を達成する。

実験結果

リサーチクエスチョン

  • RQ1ミニマルなカーネル表現は、テキスト検出において高精度と GPU 並列後処理の両立を可能にするか?
  • RQ2画像分類からの転移学習とは対照的に、テキスト固有のニューラルアーキテクチャサーチ(NAS)戦略は、検出性能をどのように向上させるか?
  • RQ3GPU 並列後処理パイプラインとテキスト検出に特化したカスタムバックボーンを組み合わせた場合、精度と速度の向上はどの程度見られるか?
  • RQ4TensorRT を用いることで、任意形状テキストベンチマークにおける F-スコアを維持したまま、推論速度をどの程度向上できるか?

主な発見

  • FAST-T-448 は Total-Text で 152.8 FPS で 81.6% の F-スコアを達成し、従来の最速手法 PAN-320 よりも F-スコアで 1.7 ポints 高く、速度面でも 70 FPS 以上高速である。
  • TensorRT 最適化を施した結果、FAST-T-448 はバッチサイズ 8 時に 634.7 FPS を達成し、実用的なデプロイ効率の高さを示している。
  • FAST-B-800 は Total-Text で 87.5% の F-スコアを 46.0 FPS で達成し、リアルタイム推論を維持しながら、PSENet-4s よりも精度と FLOPs(87.5% 対 79.6%、100.1G 対 345.9G)で顕著な優位性を示している。
  • Total-Text において、FAST-T-512 は 29.5G の FLOPs で 83.5% の F-スコアを達成し、類似した FLOPs を有する DB-R18(82.8% F-スコア)を上回っている。
  • FAST-S-512 は 9.7M パラメータの小型モデルでありながら、115.5 FPS で 84.9% の F-スコアを達成し、優れた性能を示している。
  • NAS 最適化による TextNet バックボーンは、本番のタスクに特化していない MobileNetV3 や ResNet18 よりも強力な特徴を提供している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。