Skip to main content
QUICK REVIEW

[论文解读] Real-World Font Recognition Using Deep Network and Domain Adaptation

Zhangyang Wang, Shuicheng Yan|arXiv (Cornell University)|Mar 31, 2015
Advanced Image and Video Retrieval Techniques参考文献 6被引用 5
一句话总结

本文提出一种用于真实世界字体识别的深度域自适应方法,采用堆叠卷积自编码器(SCAE)来弥合合成训练数据与真实世界测试图像之间的域差距。通过在无标签的合成数据和真实图像上联合预训练前两层卷积层,并在有标签的合成数据上微调剩余层,该模型在VFRWild325基准上实现了20.62%的top-5错误率,显著优于先前方法。

ABSTRACT

We address a challenging fine-grain classification problem: recognizing a font style from an image of text. In this task, it is very easy to generate lots of rendered font examples but very hard to obtain real-world labeled images. This real-to-synthetic domain gap caused poor generalization to new real data in previous methods (Chen et al. (2014)). In this paper, we refer to Convolutional Neural Networks, and use an adaptation technique based on a Stacked Convolutional Auto-Encoder that exploits unlabeled real-world images combined with synthetic data. The proposed method achieves an accuracy of higher than 80% (top-5) on a real-world dataset.

研究动机与目标

  • 为解决由于合成训练数据与真实世界测试图像之间存在域差距而导致的字体识别泛化能力差的问题。
  • 利用有限的有标签真实世界样本,提升在真实世界数据上的细粒度字体分类性能。
  • 结合大规模合成数据与无标签的真实世界图像,以增强模型鲁棒性。
  • 通过使用无监督域自适应技术,减少对昂贵真实世界标注的依赖。

提出的方法

  • 在无标签的合成文本图像与真实世界文本图像组合上训练堆叠卷积自编码器(SCAE),以学习共享的低级视觉特征。
  • 将SCAE的前K=2个卷积层迁移至受ImageNet模型启发的CNN架构中,形成共享特征编码器。
  • 使用标准反向传播算法,在2,383个有标签的合成字体类别上以监督方式训练CNN的剩余N−K层。
  • 对合成训练数据应用保持标签不变的数据增强方法——如改变字符间距、长宽比,以及应用模糊、噪声和阴影等失真——以提升域鲁棒性。
  • SCAE采用对称架构初始化,并使用输入与重建块之间的均方误差(MSE)进行训练。
  • 该方法结合了在混合域上的无监督预训练与有监督微调,实现了对真实世界分布偏移的有效适应。

实验结果

研究问题

  • RQ1在无标签真实世界样本的情况下,仅在合成字体数据上训练的深度神经网络能否有效泛化到真实世界字体识别任务?
  • RQ2堆叠卷积自编码器在学习合成与真实世界文本图像之间共享的低级特征方面,对域自适应的有效性如何?
  • RQ3保持标签信息的数据增强方法在多大程度上能减少字体识别中的域差距?
  • RQ4与纯合成训练相比,联合在无标签真实与合成数据上进行预训练,是否能提升在真实世界基准上的top-1与top-5准确率?

主要发现

  • 所提方法在VFRWild325真实世界字体识别基准上实现了20.62%的top-5错误率,显著优于基线方法LFE。
  • 与LFE基线相比,该模型将top-1错误率降低了6个百分点,top-5错误率降低了10个百分点。
  • 在合成数据与无标签真实世界数据上进行SCAE预训练,显著提升了模型在真实世界测试图像上的泛化能力。
  • 保持标签不变的数据增强方法——如调整间距、长宽比以及应用模糊、噪声和阴影等失真——显著提升了模型对真实世界变化的鲁棒性。
  • 该方法表明,通过SCAE实现的无监督域自适应能够有效弥合细粒度字体识别中从合成到真实世界的域差距。
  • 性能提升归因于早期CNN层中的共享特征学习,这些特征捕捉了两个域共有的视觉模式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。