Skip to main content
QUICK REVIEW

[论文解读] Self-Training for Domain Adaptive Scene Text Detection

Yudi Chen, Wei Wang|arXiv (Cornell University)|May 23, 2020
Handwritten Text Recognition Techniques参考文献 38被引用 4
一句话总结

本文提出了一种用于领域自适应场景文本检测的自训练框架,利用未标注的视频和图像挖掘高质量的伪标签难例。通过一种新型文本挖掘模块(TMM)融合检测与跟踪结果,并在缺乏视频时采用图像到视频生成方法(Gen-Loop),该方法在 ICDAR2015 和 MSRA-TD500 上实现了最先进性能,且标注成本极低。

ABSTRACT

Though deep learning based scene text detection has achieved great progress, well-trained detectors suffer from severe performance degradation for different domains. In general, a tremendous amount of data is indispensable to train the detector in the target domain. However, data collection and annotation are expensive and time-consuming. To address this problem, we propose a self-training framework to automatically mine hard examples with pseudo-labels from unannotated videos or images. To reduce the noise of hard examples, a novel text mining module is implemented based on the fusion of detection and tracking results. Then, an image-to-video generation method is designed for the tasks that videos are unavailable and only images can be used. Experimental results on standard benchmarks, including ICDAR2015, MSRA-TD500, ICDAR2017 MLT, demonstrate the effectiveness of our self-training method. The simple Mask R-CNN adapted with self-training and fine-tuned on real data can achieve comparable or even superior results with the state-of-the-art methods.

研究动机与目标

  • 解决深度学习方法在新领域部署时因标注数据有限而导致的性能严重下降问题。
  • 通过利用未标注的视频和图像进行自训练,减少对昂贵且耗时的数据标注的依赖。
  • 通过自动化的、噪声减少的难例挖掘,提升模型在目标领域的泛化能力和性能。
  • 当仅提供图像时,通过图像到视频生成方法(Gen-Loop)合成视频序列,实现有效的自训练。

提出的方法

  • 提出一种自训练框架,基于源域数据初始化检测器,并利用未标注目标域视频或图像中的伪标签示例进行再训练。
  • 文本挖掘模块(TMM)融合检测与跟踪结果,以过滤噪声预测并识别高置信度的难例。
  • 检测结果由基于 Mask R-CNN 的检测器生成,而跟踪则通过模板匹配实现,以保持视频帧间目标的一致性。
  • 采用图像到视频生成方法(Gen-Loop)从静态图像合成类似视频的序列,从而在缺乏真实视频时仍可实现自训练。
  • 在再训练过程中应用平衡损失,以稳定学习并提升在伪标签数据上的收敛性。
  • 该框架支持视频和图像输入,并通过多轮自训练迭代实现逐步优化。

实验结果

研究问题

  • RQ1利用未标注视频和图像中的伪标签示例进行自训练,能否有效提升在无标注或极少标注的目标领域的场景文本检测性能?
  • RQ2如何有效融合检测与跟踪结果,以减少伪标签中的噪声并提升挖掘出的难例质量?
  • RQ3在目标领域仅提供图像时,图像到视频生成方法(Gen-Loop)能在多大程度上实现有效的自训练?
  • RQ4与数据生成和领域自适应技术相比,该方法在训练数据性能和真实性方面表现如何?
  • RQ5在不进行网络结构修改的前提下,简单的检测器(如 Mask R-CNN)能否通过自训练实现最先进性能?

主要发现

  • 在 ICDAR2015 上,该自训练框架在使用真实目标数据微调后,F1 分数达到 84.2,比最佳基线高出 1.2%,超越了以往最先进方法。
  • 在 MSRA-TD500 上,当以 15VID 作为源域并在目标数据上进行自训练时,F1 分数从 70.0 提升至 79.1,展现出强大的领域自适应能力。
  • 即使不使用外部数据,该方法在 ICDAR2015 上仍达到 81.0 的 F1 分数,优于使用 800k 张合成图像作为额外数据的方法。
  • 引入数据增强(AUG)后,ICDAR2015 上的性能进一步提升至 88.2 F1,达到或超过文献中报告的最佳结果。
  • Gen-Loop 方法使仅基于图像的数据也能实现有效的自训练,在增强数据下于 MSRA-TD500 上达到 84.3 F1,表明其在数据稀缺场景下的有效性。
  • TMM 显著降低了伪标签中的噪声,这在多个基准和领域中均表现出一致的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。