Skip to main content
QUICK REVIEW

[論文レビュー] Improving Text Proposals for Scene Images with Fully Convolutional Networks

Dena Bazazian, Raúl Gómez|arXiv (Cornell University)|Feb 16, 2017
Handwritten Text Recognition Techniques参考文献 11被引用数 20
ひとこと要約

本稿では、テキストプロポーザル手法によって生成されたプロポーザルを再ランク付けするために、完全畳み込みネットワーク(FCN)を統合することで、シーン画像内のテキストプロポーザル品質を向上させる新規手法を提案する。FCNが予測するテキスト確率ヒートマップと、グループ化品質スコアを用いた抑制戦略を組み合わせることで、大幅に少ないプロポーザル数で最先端のリCALLを達成し、ICDARおよびCOCO-Textベンチマークで優れた性能を示した。

ABSTRACT

Text Proposals have emerged as a class-dependent version of object proposals - efficient approaches to reduce the search space of possible text object locations in an image. Combined with strong word classifiers, text proposals currently yield top state of the art results in end-to-end scene text recognition. In this paper we propose an improvement over the original Text Proposals algorithm of Gomez and Karatzas (2016), combining it with Fully Convolutional Networks to improve the ranking of proposals. Results on the ICDAR RRC and the COCO-text datasets show superior performance over current state-of-the-art.

研究の動機と目的

  • シーン画像内のテキストプロポーザルのランク付けを改善し、誤検出を低減しつつ高いリCALLを維持すること。
  • 元のテキストプロポーザル手法には、高いリCALLを達成するが多くの誤検出を生じるという限界があるため、それを是正すること。
  • 完全畳み込みネットワーク(FCN)が保持する空間的特徴を活用し、より正確なテキスト領域スコアリングを実現すること。
  • FCNベースのテキスト確率スコアと、テキストプロポーザルからのグループ化品質スコアを統合し、プロポーザルのランク付けを改善すること。
  • 実データおよび合成データセットを用いた、さまざまなランク付けおよび抑制戦略の有効性を評価すること。

提案手法

  • 本手法は、ピクセル単位のテキスト確率を予測する完全畳み込みネットワーク(FCN)を訓練し、テキスト領域の粗いヒートマップを生成する。
  • 得られたFCNヒートマップを用いて、テキストプロポーザル手法が生成したプロポーザルを、各プロポーザル内における平均テキスト確率に基づいて再ランク付けする。
  • 抑制戦略として、FCNのテキスト確率と元のテキストプロポーザルのグループ化品質スコアを組み合わせ、ランク付けの精度を向上させる。
  • 抑制のしきい値は実験的に最適化され、ICDARおよびCOCO-Textデータセットで0.10が最良のパフォーマンスを示した。
  • 一般化性能を評価するため、COCO-Text、ICDAR、SYNTHの異なる学習データソースを評価したが、性能差は最小限にとどまった。
  • 最終的なランク付け戦略では、FCNの信頼度とグループ化品質の重み付き組み合わせを用い、テキストブロック全体の領域と一致するプロポーザルを優先する。

実験結果

リサーチクエスチョン

  • RQ1FCNが予測するテキスト確率ヒートマップは、テキストプロポーザル手法が生成するプロポーザルのランク付けを向上させることができるか?
  • RQ2FCNスコアとグループ化品質スコアを組み合わせることで、プロポーザルのリCALLと精度にどのような影響を与えるか?
  • RQ3プロポーザルランク付けにおいて、FCN信頼度とグループ化品質を統合する最適な抑制しきい値は何か?
  • RQ4実データまたは合成データでFCNを学習させた場合、テキストプロポーザルランク付けにおいてどちらがより優れた一般化性能を示すか?
  • RQ5標準ベンチマークにおいて、本手法はベースラインのテキストプロポーザルおよび最先端の手法と比較してどのように評価されるか?

主な発見

  • しきい値0.10の抑制戦略が、すべてのデータセットおよびプロポーザル数において最高の検出率を達成した。
  • ICDAR-Challenge4では、抑制戦略(SUP_COCO 0.10)が1000プロポーザルで85%の検出率を達成し、ベースライン(77%)およびMTP戦略を上回った。
  • COCO-Textでは、抑制戦略が1000プロポーザルで78%の検出率を達成し、ベースライン(63%)およびMTP戦略を上回った。
  • 平均テキスト確率ランク付け戦略(MTP)は、ベースラインに比べ顕著に劣っており、完全なテキストブロックではなく小さなテキスト断片を優先していた。
  • COCO-Textで学習したFCNモデルが最も優れた結果を示し、ICDARやSYNTHで学習した場合の性能差は最小限にとどまった。
  • 定性的な結果から、本手法が多言語、手書き、さまざまな方向・長さの変形テキストを含む多様なテキストタイプの検出において、高いロバスト性を示していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。