Skip to main content
QUICK REVIEW

[論文レビュー] TextMountain: Accurate Scene Text Detection via Instance Segmentation

Yixing Zhu, Jun Du|arXiv (Cornell University)|Nov 30, 2018
Handwritten Text Recognition Techniques参考文献 33被引用数 18
ひとこと要約

TextMountainは、テキスト中心境界確率(TCBP)とテキスト中心方向(TCD)予測を用いたインスタンスセグメンテーションによる新しいシーンテキスト検出手法を提案する。これにより、テキストインスタンスの正確な分離とグループ化が可能となる。MLTでは76.85%、SCUT-CTW1500では83.2%の最先端のF-measureを達成し、GPU加速された後処理により高速な推論が実現される。

ABSTRACT

In this paper, we propose a novel scene text detection method named TextMountain. The key idea of TextMountain is making full use of border-center information. Different from previous works that treat center-border as a binary classification problem, we predict text center-border probability (TCBP) and text center-direction (TCD). The TCBP is just like a mountain whose top is text center and foot is text border. The mountaintop can separate text instances which cannot be easily achieved using semantic segmentation map and its rising direction can plan a road to top for each pixel on mountain foot at the group stage. The TCD helps TCBP learning better. Our label rules will not lead to the ambiguous problem with the transformation of angle, so the proposed method is robust to multi-oriented text and can also handle well with curved text. In inference stage, each pixel at the mountain foot needs to search the path to the mountaintop and this process can be efficiently completed in parallel, yielding the efficiency of our method compared with others. The experiments on MLT, ICDAR2015, RCTW-17 and SCUT-CTW1500 databases demonstrate that the proposed method achieves better or comparable performance in terms of both accuracy and efficiency. It is worth mentioning our method achieves an F-measure of 76.85% on MLT which outperforms the previous methods by a large margin. Code will be made available.

研究の動機と目的

  • 高い精度で長さが長く、複数の方向や曲がったテキストラインを検出する課題に対処する。
  • 従来のセマンティックセグメンテーションや二値中心境界分類によるテキストインスタンス分離の曖昧さを克服する。
  • TCBPのマウンテン構造を活用して、ピクセルの並列グループ化を可能にすることで、推論における後処理時間を短縮する。
  • 固定された多角形頂点順序に依存せずに、多様なテキスト形状や方向性に対しても頑健な性能を発揮する。
  • 高解像度画像やリアルタイムアプリケーションに適した効率的でスケーラブルな推論を実現する。

提案手法

  • ピクセル値がテキスト中心で1、テキスト境界で0に減少するテキスト中心境界確率(TCBP)マップを予測し、『マウンテン』構造を形成する。
  • TCBP学習をガイドし、特徴表現を向上させるためにテキスト中心方向(TCD)を導入するが、推論では使用しない。
  • TCBPの上昇方向を活用して、境界ピクセルからマウンテントップへパスを計画し、グループ単位でのインスタンス分離を実現する。
  • すべてのピクセルを同時に処理するGPU加速並列グループ化アルゴリズムを実装し、後処理時間を著しく短縮する。
  • 完全畳み込みネットワーク(FCN)を用いて、テキストスコア(TS)、TCBP、TCDマップをエンドツーエンドで同時に予測する。
  • 回転や曲がりに対して不変なラベルルールを適用し、複数方向および曲がったテキストに対する頑健性を確保する。

実験結果

リサーチクエスチョン

  • RQ1マウンテン構造を持つ学習済みTCBPマップは、固定されたバウンディングボックスに依存せずに、隣接するテキストインスタンスを効果的に分離できるか?
  • RQ2TCDの予測がTCBP学習の品質を向上させ、曲がったテキストや複数方向テキストに対してより良い一般化をもたらすか?
  • RQ3TCBPマップにおける境界から中心への並列パス探索は、逐次的グループ化と比較して後処理を著しく高速化できるか?
  • RQ4従来の最先端手法と比較して、長さが長く、複数方向で曲がったテキストラインを含むデータセット上での本手法の性能はいかがなものか?
  • RQ5本手法は、回転やスケーリングなどの画像変換に対しても、ラベルの曖昧さを導入せずに頑健性を維持できるか?

主な発見

  • TextMountainはMLTデータセットで76.85%のF-measureを達成し、従来手法を顕著に上回った。
  • SCUT-CTW1500では82.9%の精度、83.4%の再現率、83.2%のF-measureを達成し、曲がったテキスト検出において強力な性能を示した。
  • ICDAR2015では10.5 FPSで動作し、GPUベースのグループ化はCPUベースのcython実装と比較して200倍以上高速だった。
  • 高解像度のRCTW-17画像(長辺1500)では、GPUグループ化が1枚あたり0.0013秒で完了したのに対し、CPUグループ化では1.2910秒を要した。
  • TCBPに基づくグループ化機構により、テキストライン全体をカバーする受容 field が不要な状態で、長めのテキストラインに対しても高い精度を維持できた。
  • TCDコンponentはTCBP学習を向上させ、全ベンチマークデータセットで一貫した性能向上が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。