[論文レビュー] Synthetic-to-Real Unsupervised Domain Adaptation for Scene Text Detection in the Wild
本論文は、テキスト自己学習(TST)と敵対的テキストインスタンスアライメント(ATA)を用いた、合成データから実画像への自己教師ありドメイン変換手法を提案する。TSTは、偽ラベルからの誤検出および見逃しを低減する。一方、ATAは敵対的学習によりドメイン不変特徴を強制的に学習する。合成データから実データに転移する際、ICDAR2013では最大11.3%、ICDAR2015では9.3%のFスコア向上を達成した。
Deep learning-based scene text detection can achieve preferable performance, powered with sufficient labeled training data. However, manual labeling is time consuming and laborious. At the extreme, the corresponding annotated data are unavailable. Exploiting synthetic data is a very promising solution except for domain distribution mismatches between synthetic datasets and real datasets. To address the severe domain distribution mismatch, we propose a synthetic-to-real domain adaptation method for scene text detection, which transfers knowledge from synthetic data (source domain) to real data (target domain). In this paper, a text self-training (TST) method and adversarial text instance alignment (ATA) for domain adaptive scene text detection are introduced. ATA helps the network learn domain-invariant features by training a domain classifier in an adversarial manner. TST diminishes the adverse effects of false positives~(FPs) and false negatives~(FNs) from inaccurate pseudo-labels. Two components have positive effects on improving the performance of scene text detectors when adapting from synthetic-to-real scenes. We evaluate the proposed method by transferring from SynthText, VISD to ICDAR2015, ICDAR2013. The results demonstrate the effectiveness of the proposed method with up to 10% improvement, which has important exploration significance for domain adaptive scene text detection. Code is available at https://github.com/weijiawu/SyntoReal_STD
研究の動機と目的
- 合成データと実画像のシーンテキストデータセット間のドメインシフトを解消し、合成データのみで学習した場合のモデル性能の低下を是正すること。
- 自己学習におけるノイズの多い偽ラベル(誤検出および見逃し)の負の影響を低減すること。
- テキストインスタンスレベルの表現に対して敵対的学習を用いて、ドメイン不変特徴を学習すること。
- ラベル付き実データを必要とせず、合成データ(ソースドメイン)から実世界データ(ターゲットドメイン)への有効な知識転送を可能にすること。
提案手法
- テキスト自己学習(TST)を導入し、ストローク幅の一貫性と信頼度の閾値を用いて、信頼度の低い予測をフィルタリングすることで、偽ラベルを精錬する。
- パラメータ ε₁ と ε₂ を用いた閾値ベースのフィルタリング機構を導入し、偽ラベルのインスタンスにおける誤検出および見逃しを抑制する。
- ドメイン識別器を訓練し、敵対的学習の形で、ソース(合成)とターゲット(実)のテキスト特徴を区別する。
- 検出ヘッド、TSTの精錬、敵対的損失を統合的に最適化することで、ドメイン間で特徴をアライメントしつつ、検出精度を維持する。
- EASTベースの検出器を用い、事前学習後に合成データで学習した後、実データをラベルなしでファインチューニングに活用する。
- フレームワークは、ソースデータにおける教師あり損失と、ターゲットデータにおける精錬済み偽ラベルを用いた自己学習を組み合わせ、エンドツーエンドで学習する。
実験結果
リサーチクエスチョン
- RQ1テキスト自己学習は、シーンテキスト検出のドメイン変換において、偽ラベルの誤検出および見逃しを効果的に低減できるか?
- RQ2敵対的テキストインスタンスアライメントは、合成ドメインと実ドメイン間で特徴の一般化をどの程度向上できるか?
- RQ3提案手法は、合成データから実世界のシーンテキスト検出ベンチマークへの知識転送において、どの程度有効か?
- RQ4ハイパーパrameterの選択(例:ε₁、ε₂)は、自己学習部の性能にどのような影響を及えるか?
主な発見
- 提案手法は、SynthText から ICDAR2013 に転移する際、Fスコアで11.3%の絶対的向上を達成し、ベースラインを著しく上回った。
- SynthText → ICDAR2015 への転移においても、Fスコアは9.3%向上し、強力なドメイン変換性能を示した。
- VISD をソースドメインとして使用した場合、ICDAR2015 でFスコアが9.3%向上し、異なる合成データ分布に対しても有効性が確認された。
- アブレーションスタディにより、TST と ATA の併用が最も高い性能向上(SynthText → ICDAR2015 で7.5%)をもたらし、両成分が独立に寄与していることが確認された。
- ハイパーパrameter感受性分析の結果、ε₁ = 3 と ε₂ = 0.3 が最適な性能を示し、結果はハイパーパrameterの変動に対して比較的ロバストであった。
- 定性的な結果から、複雑な背景や多様なテキスト形状に対しても、誤検出が減少し、より良好な局所化が実現された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。