Skip to main content
QUICK REVIEW

[论文解读] DG-Font: Deformable Generative Networks for Unsupervised Font Generation

Yangchen Xie, Xinyuan Chen|arXiv (Cornell University)|Apr 7, 2021
Generative Adversarial Networks and Image Synthesis参考文献 50被引用 9
一句话总结

该论文提出DG-Font,一种新颖的无监督字体生成模型,采用可变形生成网络在无需成对训练数据的情况下合成高质量字符。通过引入特征可变形跳跃连接(FDSC),该方法预测位移图以应用于可变形卷积,并在内容编码器中使用可变形卷积,有效传递几何风格的同时保持结构完整性,在中文字体生成任务中实现最先进性能,显著提升感知质量和结构保真度。

ABSTRACT

Font generation is a challenging problem especially for some writing systems that consist of a large number of characters and has attracted a lot of attention in recent years. However, existing methods for font generation are often in supervised learning. They require a large number of paired data, which is labor-intensive and expensive to collect. Besides, common image-to-image translation models often define style as the set of textures and colors, which cannot be directly applied to font generation. To address these problems, we propose novel deformable generative networks for unsupervised font generation (DGFont). We introduce a feature deformation skip connection (FDSC) which predicts pairs of displacement maps and employs the predicted maps to apply deformable convolution to the low-level feature maps from the content encoder. The outputs of FDSC are fed into a mixer to generate the final results. Taking advantage of FDSC, the mixer outputs a high-quality character with a complete structure. To further improve the quality of generated images, we use three deformable convolution layers in the content encoder to learn style-invariant feature representations. Experiments demonstrate that our model generates characters in higher quality than state-of-art methods. The source code is available at https://github.com/ecnuycxie/DG-Font.

研究动机与目标

  • 为解决无监督字体生成的挑战,特别是针对汉字等表意文字脚本中大规模字符集导致成对数据收集成本高昂的问题。
  • 克服现有图像到图像翻译模型将风格定义为纹理和颜色的局限性,这些方法难以捕捉字体中的几何风格。
  • 通过解耦内容与风格表征,同时保留笔画末端、粗细变化等结构细节,实现高保真度的字体生成。
  • 开发一种方法,无需成对样本或如笔画、部首等标注标签,即可在未见字体上实现良好泛化。

提出的方法

  • 提出特征可变形跳跃连接(FDSC)模块,用于预测位移图对,以对内容编码器中的低级特征应用可变形卷积。
  • 在内容编码器中使用可变形卷积层,学习与风格无关的特征表示,提升对几何变化的鲁棒性。
  • 采用多任务判别器,确保风格表征的判别能力,并支持独立风格判别。
  • 在FDSC模块中引入偏移归一化损失,约束学习到的偏移量,提升源字符与目标字符结构之间的对齐性。
  • 应用两种重建损失(L1损失与感知损失)及多尺度感知损失,以保留生成字符的结构与语义细节。
  • 使用混合网络将内容与风格特征融合,生成具有完整且逼真结构的最终输出图像。

实验结果

研究问题

  • RQ1生成模型是否能在不依赖成对训练数据的前提下实现高质量的无监督字体生成?
  • RQ2在无监督设置下,如何有效建模并迁移源字体与目标字体之间的几何形变?
  • RQ3与标准跳跃连接相比,可变形卷积与位移图是否能提升字体生成中的结构保真度?
  • RQ4使用风格不变特征与偏移约束是否能提升未见字体风格下的泛化能力与视觉质量?

主要发现

  • FDSC模块显著提升了结构保真度,生成的字符具有完整且连贯的形状,与基线模型的定性对比结果表明其优势。
  • 在内容编码器中引入可变形卷积层后,L1损失、RMSE与SSIM指标均有可测量的改善,表明特征表示与重建质量更优。
  • FDSC模块中的偏移归一化显著提升了风格迁移质量,使生成字符在外观与结构上更接近目标字体。
  • 将FDSC替换为标准跳跃连接后性能明显下降,证实FDSC的可变形特征迁移对几何风格建模至关重要。
  • 可视化结果表明,学习到的偏移主要作用于笔画区域,并引导从源笔画到目标笔画的采样位置,验证了模型学习有意义空间形变的能力。
  • 包含两个FDSC模块的完整模型在定量与定性结果上均表现最佳,生成字符具备丰富的细节,如笔画末端、粗细变化及连笔书写特征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。