Skip to main content
QUICK REVIEW

[论文解读] Coconditional Autoencoding Adversarial Networks for Chinese Font Feature Learning

Zhizhan Zheng, Feiyun Zhang|arXiv (Cornell University)|Dec 11, 2018
Generative Adversarial Networks and Image Synthesis参考文献 13被引用 5
一句话总结

本文提出了一种名为协同条件自编码对抗网络(CocoAAN)的新框架,通过成对替换优化训练的两个编码网络,将汉字字形图像解耦为内容与风格特征,并利用对抗生成器合成逼真的汉字。该模型在无需人工部件分割的情况下,实现了对未见字体和字符的强大泛化能力,展示了无监督条件下出色的解耦与风格/内容迁移性能。

ABSTRACT

In this work, we propose a novel framework named Coconditional Autoencoding Adversarial Networks (CocoAAN) for Chinese font learning, which jointly learns a generation network and two encoding networks of different feature domains using an adversarial process. The encoding networks map the glyph images into style and content features respectively via the pairwise substitution optimization strategy, and the generation network maps these two kinds of features to glyph samples. Together with a discriminative network conditioned on the extracted features, our framework succeeds in producing realistic-looking Chinese glyph images flexibly. Unlike previous models relying on the complex segmentation of Chinese components or strokes, our model can "parse" structures in an unsupervised way, through which the content feature representation of each character is captured. Experiments demonstrate our framework has a powerful generalization capacity to other unseen fonts and characters.

研究动机与目标

  • 为解决人工中文字体设计的高成本与复杂性,通过自动化字形合成实现设计流程的自动化。
  • 在不依赖部首或笔画人工分割的前提下,学习中文字符的解耦内容与风格表征。
  • 通过无监督特征学习实现对未见字体与字符的泛化能力。
  • 相比现有的 VAE 或 GAN 方法,提升生成质量与风格迁移保真度。
  • 在端到端可训练的框架中,建模不同字体与字符之间风格与内容的共现特性。

提出的方法

  • 该框架采用两个编码网络:一个用于风格特征,一个用于内容特征,通过成对替换优化策略进行训练,以强制实现解耦。
  • 生成网络从拼接后的风格与内容特征中合成字形图像,通过对抗训练生成逼真输出。
  • 判别网络以提取的风格与内容特征为条件,以增强生成样本的真实性。
  • 模型采用协同条件自编码机制,利用不同字体与字符之间的共享风格与内容表征。
  • 通过对批次内的特征向量进行平均,推断未见字体与字符的新风格与内容嵌入。
  • 应用 t-SNE 可视化验证了基于共享部首的内容特征聚类具有语义意义,表明实现了无监督的结构学习。

实验结果

研究问题

  • RQ1深度学习模型能否在无需人工部件分割的情况下,自动将汉字字形图像解耦为有意义的内容与风格表征?
  • RQ2该模型在生成未见字体与字符的逼真字形方面表现如何?
  • RQ3所学习的风格与内容特征是否支持平滑插值与有意义的风格迁移?
  • RQ4成对替换优化策略是否能有效强制实现内容与风格特征之间的解耦?
  • RQ5在重建质量与泛化能力方面,该模型相较于现有 VAE 与 GAN 方法表现如何?

主要发现

  • 模型能够以高保真度重建汉字字形,视觉对比显示 CocoAAN 生成的样本在 128×128 分辨率下与真实样本高度接近。
  • 在风格潜在空间中的线性插值可实现从细体到粗体的平滑过渡,证实模型学习到了有意义且连续的风格表征。
  • 内容编码网络在潜在空间中将具有相似部首的字符聚类在一起,表明其在无显式结构监督下实现了无监督的结构理解。
  • 模型对未见字体具有良好的泛化能力:通过测试数据推断新风格特征并生成合理字形,尽管部分细节(如衬线)偶尔会丢失。
  • 模型对未见字符(包括 GB-2312 中的罕见与繁体字形)也具有泛化能力,大多数字符生成准确,但部分出现笔画重叠或失真。
  • 与 VAE 和 GAN 基线模型相比,CocoAAN 生成的样本更清晰、更逼真,解耦效果更好,泛化能力更强,尤其在风格迁移与内容泛化方面表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。