Skip to main content
QUICK REVIEW

[论文解读] DeepFont: Identify Your Font from An Image

Zhangyang Wang, Shuicheng Yan|arXiv (Cornell University)|Jul 12, 2015
Video Analysis and Summarization参考文献 17被引用 9
一句话总结

DeepFont 提出了一种基于深度学习的视觉字体识别(VFR)系统,采用大规模数据集(AdobeVFR)和经过领域自适应的卷积神经网络(CNN),结合堆叠卷积自编码器(SCAE),以弥合模拟到真实世界的领域差距。该系统在 top-5 准确率上超过 80%,并实现了无损模型压缩,将模型大小减少 6 倍而无性能损失,同时为设计应用提供了鲁棒的字体相似性度量方法。

ABSTRACT

As font is one of the core design concepts, automatic font identification and similar font suggestion from an image or photo has been on the wish list of many designers. We study the Visual Font Recognition (VFR) problem, and advance the state-of-the-art remarkably by developing the DeepFont system. First of all, we build up the first available large-scale VFR dataset, named AdobeVFR, consisting of both labeled synthetic data and partially labeled real-world data. Next, to combat the domain mismatch between available training and testing data, we introduce a Convolutional Neural Network (CNN) decomposition approach, using a domain adaptation technique based on a Stacked Convolutional Auto-Encoder (SCAE) that exploits a large corpus of unlabeled real-world text images combined with synthetic data preprocessed in a specific way. Moreover, we study a novel learning-based model compression approach, in order to reduce the DeepFont model size without sacrificing its performance. The DeepFont system achieves an accuracy of higher than 80% (top-5) on our collected dataset, and also produces a good font similarity measure for font selection and suggestion. We also achieve around 6 times compression of the model without any visible loss of recognition accuracy.

研究动机与目标

  • 为解决视觉字体识别(VFR)缺乏大规模、真实世界标注数据的问题,该问题限制了现有方法的性能。
  • 为克服合成训练数据与真实世界测试图像之间的领域偏移问题,该问题会降低先前 VFR 系统的泛化能力。
  • 开发一种紧凑且可部署的深度学习模型用于 VFR,同时不牺牲识别准确率。
  • 实现有效的字体相似性度量,以支持设计软件中智能字体建议与浏览功能。

提出的方法

  • 构建 AdobeVFR 数据集,包含标注的合成字体和部分标注的真实世界图像,形成首个大规模 VFR 基准数据集。
  • 应用堆叠卷积自编码器(SCAE)进行领域自适应,利用未标注的真实世界图像对齐合成数据与真实数据之间的特征分布。
  • 设计一种基于学习的模型压缩方法,对 fc6 层权重矩阵施加精确的低秩约束,以实现无损压缩。
  • 使用 fc7 层特征(4096×1)作为高层视觉表征,通过类平均向量之间的欧氏距离计算字体相似性。
  • 在微调过程中引入硬阈值化,迭代压缩 fc6 层,同时保持性能稳定。
  • 采用两阶段训练流程:先在合成数据上进行预训练,再使用 SCAE 在未标注的真实数据上进行领域自适应。

实验结果

研究问题

  • RQ1大规模、真实世界的 VFR 数据集是否能显著提升字体识别系统的性能?
  • RQ2通过 SCAE 实现的领域自适应在多大程度上能有效减小视觉字体识别中的模拟到真实领域的差距?
  • RQ3基于学习的模型压缩技术是否能在保持识别准确率的前提下实现高倍率压缩?
  • RQ4DeepFont 学习到的特征表征是否能为设计应用提供有意义的字体相似性度量?

主要发现

  • DeepFont 系统在真实世界测试集上的 top-5 识别准确率达到 80% 或以上,显著超越当前技术水平。
  • 基于 SCAE 的领域自适应方法有效减小了模拟到真实世界的领域差距,使模型在真实世界图像上具备鲁棒的泛化能力。
  • 所提出的无损模型压缩方法在 fc6 层实现了 5.79 倍的压缩率,且无可见性能损失,k=100 时 top-5 错误率保持在 18.21%。
  • 仅含 950 万个参数(40 MB)的高度压缩版 'mini' DeepFont 模型,top-5 错误率约为 22%,适用于移动设备部署。
  • 该系统基于 fc7 特征生成了可靠的字体相似性度量,在视觉相似性排序任务中,其结果在定性上显著优于先前方法。
  • 该模型压缩方法在高倍率压缩下始终优于传统矩阵分解(有损)方法,尤其在 k=5 时实现了 1.4% 的绝对性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。