[论文解读] Synthetic-to-Real Unsupervised Domain Adaptation for Scene Text Detection in the Wild
本文提出了一种用于场景文本检测的从合成到真实的无监督域自适应方法,结合了文本自训练(TST)与对抗性文本实例对齐(ATA)。TST通过减少伪标签中的误报和漏报来提升性能,而ATA则通过对抗性学习实现域不变特征,当从合成数据迁移到真实数据时,在ICDAR2013上实现了最高11.3%的F-score提升,在ICDAR2015上实现了9.3%的提升。
Deep learning-based scene text detection can achieve preferable performance, powered with sufficient labeled training data. However, manual labeling is time consuming and laborious. At the extreme, the corresponding annotated data are unavailable. Exploiting synthetic data is a very promising solution except for domain distribution mismatches between synthetic datasets and real datasets. To address the severe domain distribution mismatch, we propose a synthetic-to-real domain adaptation method for scene text detection, which transfers knowledge from synthetic data (source domain) to real data (target domain). In this paper, a text self-training (TST) method and adversarial text instance alignment (ATA) for domain adaptive scene text detection are introduced. ATA helps the network learn domain-invariant features by training a domain classifier in an adversarial manner. TST diminishes the adverse effects of false positives~(FPs) and false negatives~(FNs) from inaccurate pseudo-labels. Two components have positive effects on improving the performance of scene text detectors when adapting from synthetic-to-real scenes. We evaluate the proposed method by transferring from SynthText, VISD to ICDAR2015, ICDAR2013. The results demonstrate the effectiveness of the proposed method with up to 10% improvement, which has important exploration significance for domain adaptive scene text detection. Code is available at https://github.com/weijiawu/SyntoReal_STD
研究动机与目标
- 为解决仅在合成数据上训练时,合成与真实场景文本数据集之间的域偏移问题,该问题会降低模型性能。
- 减少自训练过程中伪标签中噪声(误报和漏报)对场景文本检测的负面影响。
- 通过在文本实例级表示上进行对抗性训练,学习适用于场景文本检测器的域不变特征。
- 实现在无需真实数据标注的前提下,从合成数据(源域)到真实世界数据(目标域)的有效知识迁移。
提出的方法
- 引入文本自训练(TST),通过利用笔画宽度一致性与置信度阈值,过滤低置信度预测,以优化伪标签。
- 采用基于阈值的过滤机制,参数为ε₁和ε₂,用于抑制伪标签实例中的误报和漏报。
- 对抗性文本实例对齐(ATA)通过对抗方式训练一个域判别器,以区分源域(合成)与目标域(真实)的文本特征。
- 通过检测头、TST优化与对抗损失的联合优化,实现域间特征对齐,同时保持检测精度。
- 该方法在基于EAST的检测器上进行评估,利用微调阶段的无标签真实数据,预训练阶段使用合成数据。
- 框架采用端到端训练,结合源域上的监督损失与目标域上经优化后的伪标签的自训练损失。
实验结果
研究问题
- RQ1文本自训练是否能有效减少在场景文本检测域自适应过程中伪标签中的误报和漏报?
- RQ2对抗性文本实例对齐在多大程度上能提升跨合成与真实域的特征泛化能力?
- RQ3所提方法在将知识从合成数据迁移到真实世界场景文本检测基准方面有多高效?
- RQ4超参数选择(如ε₁、ε₂)对自训练组件性能的影响如何?
主要发现
- 在从SynthText迁移到ICDAR2013时,所提方法实现了11.3%的F-score绝对提升,显著优于基线模型。
- 在SynthText → ICDAR2015的迁移任务中,F-score提升了9.3%,展现出强大的域自适应性能。
- 当使用VISD作为源域时,该方法在ICDAR2015上实现了9.3%的F-score增益,证实了其在不同合成数据分布下的有效性。
- 消融实验表明,结合TST与ATA可获得最高性能增益(在SynthText → ICDAR2015上达7.5%),且两组件独立贡献性能提升。
- 超参数敏感性分析显示,ε₁ = 3与ε₂ = 0.3时性能最优,且结果对超参数变化具有相对鲁棒性。
- 定性结果表明,模型对复杂背景和多样文本形状的鲁棒性得到提升,误报减少,定位更准确。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。