[論文レビュー] Curved Text Detection in Natural Scene Images with Semi- and Weakly-Supervised Learning
本稿では、少量のピクセル単位のアノテーションと大規模な長方形単位のアノテーションまたはラベルなしデータを活用することで、高価なピクセル単位のアノテーションに依存するのを減らす半教師ありおよび弱教師ありフレームワークを提案する。限られたピクセルアノテーションで訓練されたベースラインモデルを用い、真の境界ボックスを用いて疑似マスクアノテーションを生成する。『ローカル』戦略が他の戦略を上回り、10%のピクセル単位データと90%の弱教師ありデータでのみ、最先端の性能を達成する。
Detecting curved text in the wild is very challenging. Recently, most state-of-the-art methods are segmentation based and require pixel-level annotations. We propose a novel scheme to train an accurate text detector using only a small amount of pixel-level annotated data and a large amount of data annotated with rectangles or even unlabeled data. A baseline model is first obtained by training with the pixel-level annotated data and then used to annotate unlabeled or weakly labeled data. A novel strategy which utilizes ground-truth bounding boxes to generate pseudo mask annotations is proposed in weakly-supervised learning. Experimental results on CTW1500 and Total-Text demonstrate that our method can substantially reduce the requirement of pixel-level annotated data. Our method can also generalize well across two datasets. The performance of the proposed method is comparable with the state-of-the-art methods with only 10% pixel-level annotated data and 90% rectangle-level weakly annotated data.
研究の動機と目的
- 自然画像における曲がったテキスト検出のための高価なピクセル単位のアノテーションへの依存を低減すること。
- 限られたピクセル単位データと豊富な弱教師ありまたはラベルなしデータを効果的に活用する半教師ありおよび弱教師あり学習フレームワークの開発。
- 最小限の完全アノテーションデータで、CTW1500やTotal-Textのような異なるデータセット間での一般化性能を向上させること。
- 弱教師あり設定において真の境界ボックスを活用し、疑似マスクアノテーションを生成する新しい戦略の設計。
提案手法
- バウンディングボックスの局所化、テキスト/非テキスト分類、インスタンスレベルのマスク予測を同時に実行するマルチタスクネットワークを訓練する。
- まず、ピクセル単位のアノテーションデータの少量(例:ポリゴンマスク)を用いてベースラインモデルを訓練する。
- ベースラインモデルは、ラベルなしまたは長方形アノテーション付きデータに対して、3つの戦略(ナイーブ、フィルタ、ローカル)を用いて疑似アノテーションを生成する。
- 『ローカル』戦略は、真の境界ボックスを候補として用い、直接的に疑似マスクアノテーションを生成することで、ノイズを最小限に抑え、精度を向上させる。
- 再帰的訓練を適用し、1ラウンド目の予測出力を次のラウンドの教師信号として用いることで、反復的な最適化を実現する。
- 本手法は、ラベルなしまたは弱教師ありデータからの疑似ラベルデータと元のアノテーションを組み合わせることで、半教師ありと弱教師あり学習を統合する。
実験結果
リサーチクエスチョン
- RQ110%のピクセル単位アノテーションデータと90%の長方形単位の弱教師ありアノテーションデータでのみ、曲がったテキスト検出器を効果的に訓練できるか?
- RQ2弱教師ありの境界ボックスから、曲がったテキストの空間的・構造的詳細を保持しつつ、正確に疑似マスクアノテーションを生成する方法は何か?
- RQ3本フレームワークは、CTW1500 や Total-Text といった異なるデータセット間で十分に一般化できるか?
- RQ4ナイーブ、フィルタ、ローカルのいずれの戦略が、弱教師あり設定下で F スコアとリコールの観点で最高の性能を示すか?
- RQ5CTW1500 で訓練されたモデル(例:10%のピクセル単位データ)が、Total-Text などの別のデータセットに、長方形単位のアノテーションのみで効果的に一般化できるか?
主な発見
- 『ローカル』戦略は、CTW1500 で10%のピクセル単位データと90%の長方形単位データで F スコア 76.0%、Total-Text で 78.1% を達成し、ベースラインおよび他の戦略を上回る。
- CTW1500 では、『ローカル』戦略がベースラインの F スコアを 9.9% 向上させ、局所化ネットワークからの完全な監視のおかげでリコールの大幅な向上を達成した。
- Total-Text では、『ローカル』戦略が F スコア 78.1% を達成し、完全監視で訓練された最先端手法(78.4%)に非常に近い性能を示した。
- フィルタ戦略は、CTW1500 でナイーブ戦略に比べて 1.7% の精度向上を示し、誤検出の抑制が良好であることを示した。
- 『ローカル』戦略はデータセット間での一般化性能が優れており、CTW1500 で10%のピクセル単位データで訓練したモデルが、ターゲットドメインのアノテーションなしで Total-Text で F スコア 78.1% を達成した。
- 再帰的訓練により、複数ラウンドにわたり一貫した性能向上が見られ、『ローカル』戦略は最も速い収束と最も高い飽和性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。