[論文レビュー] Character Region Awareness for Text Detection
CRAFT は region と affinity maps を用いて個々の文字を検出し、弱教師付き学習戦略で、ファインチューニングなしに複数の曲線・任意のテキストデータセットで最先端の結果を達成します。
Scene text detection methods based on neural networks have emerged recently and have shown promising results. Previous methods trained with rigid word-level bounding boxes exhibit limitations in representing the text region in an arbitrary shape. In this paper, we propose a new scene text detection method to effectively detect text area by exploring each character and affinity between characters. To overcome the lack of individual character level annotations, our proposed framework exploits both the given character-level annotations for synthetic images and the estimated character-level ground-truths for real images acquired by the learned interim model. In order to estimate affinity between characters, the network is trained with the newly proposed representation for affinity. Extensive experiments on six benchmarks, including the TotalText and CTW-1500 datasets which contain highly curved texts in natural images, demonstrate that our character-level text detection significantly outperforms the state-of-the-art detectors. According to the results, our proposed method guarantees high flexibility in detecting complicated scene text images, such as arbitrarily-oriented, curved, or deformed texts.
研究の動機と目的
- 語句レベルのボックスを超えた任意の形状のテキストの頑健な検出を動機づける。
- 文字中心の検出フレームワークを提案し、文字領域を局在化してそれらをテキストのインスタンスに結び付ける。
- 文字注釈が欠如した実データで訓練するための弱教師付きのグラウンドトゥルース生成メカニズムを開発する。
- 曲線状およびポリゴン状のテキストを含むデータセットで最先端の性能を示す。
- 全体のテキストインスタンスではなく文字を局在化することによるスケール変動への頑健性を示す。
提案手法
- 完全畳み込みバックボーン(スキップ接続を伴う VGG-16) は、文字領域スコアと文字アフィニティスコアの2つのヒートマップを出力する。
- グラウンドトゥルース生成は、文字ボックスにワープさせたガウスヒートマップを用いて領域ラベルとアフィニティラベルを作成する。
- 弱教師あり学習は、Wordレベルの注釈をウェーターワーシップ法で文字レベルのボックスに分割して偽グラウンドトゥルースを実画像に生成し、信頼度マップで重み付けする。
- 訓練は合成データ(SynthText)と実世界の語レベルデータを組み合わせ、偽のグラウンドトゥルースの不完全性に対処するため信頼度に基づく損失を適用する。
- 推論は、領域マップとアフィニティマップを閾値処理し、連結成分ラベリングを適用することにより語レベルの四辺形ボックスを生成する。曲線テキストにはオプションとしてポリゴン風後処理を適用する。
実験結果
リサーチクエスチョン
- RQ1文字中心の表現は、 irregular shapes にあるテキスト(曲線的、長い、または任意に変形したもの)に対して、語中心の検出器よりも高い性能を示せるか?
- RQ2弱教師付き学習は、実データ上で文字注釈が明示的に与えられていなくても、効果的な文字レベルの検出を可能にするか?
- RQ3アフィニティマップによる文字レベルの結合が、スケール、向き、透視歪みに対する頑健性にどう影響するか?
- RQ4異なる注釈スタイル(長方形、四辺形、ポリゴン)を持つデータセット間で、広範なファインチューニングを行わずにモデルは一般化できるか?
主な発見
- CRAFT は四辺形データセット(ICDAR 2013/2015/2017、MSRA-TD500)で最先端の性能を達成し、高い H-measure を示す(例: IC13: 95.2 H; IC15: 86.9 H; IC17: 73.9 H)および IC13 で報告されている 8.6 FPS。
- ポリゴンタイプのデータセット(TotalText, CTW-1500)では高い H 指標を達成(TotalText: 83.6; CTW-1500: 83.5)。
- エンドツーエンド検出器と比較して、認識のエンドツーエンド訓練を受けていないにもかかわらず、TotalText: 83.6; CTW-1500: 83.5 という競争力のある H-mean を示す。
- 本法はマルチスケール検証を必要とせず、文字間の内部・相互関係に焦点を当てる小さな受容野を活用して堅牢な性能を示す。
- 補助的な LinkRefiner は CTW-1500 風のポリゴン注釈の処理を改善し、長い曲がりくねったテキストのアフィニティを refine することでポリゴン表現の結果を向上させる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。