[论文解读] Look Closer to Supervise Better: One-Shot Font Generation via Component-Based Discriminator
本文提出CG-GAN,一种一次性字体生成框架,通过组件感知模块(CAM)在组件级别进行监督,提升了风格一致性和结构准确性。通过使用基于注意力的特征提取与多任务判别器,将粗粒度监督替换为细粒度的组件级反馈,CG-GAN在一次性中文字体生成任务上达到最先进性能,并可泛化至手写词合成与场景文本编辑任务。
Automatic font generation remains a challenging research issue due to the large amounts of characters with complicated structures. Typically, only a few samples can serve as the style/content reference (termed few-shot learning), which further increases the difficulty to preserve local style patterns or detailed glyph structures. We investigate the drawbacks of previous studies and find that a coarse-grained discriminator is insufficient for supervising a font generator. To this end, we propose a novel Component-Aware Module (CAM), which supervises the generator to decouple content and style at a more fine-grained level, i.e., the component level. Different from previous studies struggling to increase the complexity of generators, we aim to perform more effective supervision for a relatively simple generator to achieve its full potential, which is a brand new perspective for font generation. The whole framework achieves remarkable results by coupling component-level supervision with adversarial learning, hence we call it Component-Guided GAN, shortly CG-GAN. Extensive experiments show that our approach outperforms state-of-the-art one-shot font generation methods. Furthermore, it can be applied to handwritten word synthesis and scene text image editing, suggesting the generalization of our approach.
研究动机与目标
- 为解决少样本字体生成中粗粒度监督的局限性,现有方法难以保持局部风格模式与字形结构。
- 通过在更细粒度的层级——即组件层级——增强监督,而非增加模型复杂度,来提升生成器性能。
- 实现对未见字体风格和未登录字符的泛化,克服以往基于组件的方法依赖预定义组件类别所带来的限制。
- 将框架扩展至字体生成以外的相关任务,如手写词合成与场景文本编辑,展示其广泛适用性。
提出的方法
- 引入组件感知模块(CAM),利用注意力机制从输入字形中提取并定位组件,实现细粒度监督。
- 采用组件级别的真实感与风格分类判别器,提供逐组件反馈,提升图像真实感与风格一致性。
- 使用三种组件级别的损失函数:结构保留损失($\mathcal{L}_{strc}$)、风格匹配损失($\mathcal{L}_{sty}$)和组件真实感损失($\mathcal{L}_{dcomp}$),实现多目标训练。
- 结合对抗性学习与组件级监督,引导生成器产出结构正确、风格一致且逼真的字形。
- 在无配对设置下训练生成器,避免对参考字体与目标字体之间成对数据的需求。
- 通过直接生成编辑后的图像,将框架扩展至场景文本编辑任务,无需多阶段渲染,有效减少前景-背景干扰。
实验结果
研究问题
- RQ1与像素级或字符级监督相比,组件级监督是否能显著提升一次性字体生成性能?
- RQ2在组件层级解耦内容与风格,是否能更好地保留局部字形结构与字体特有细节?
- RQ3当受到细粒度组件级反馈引导时,一个相对简单的生成器是否能实现最先进性能?
- RQ4所提出的框架是否具备对未见字体风格和未登录字符的泛化能力?
- RQ5该框架是否可扩展至手写词合成与场景文本编辑等相关任务?
主要发现
- CG-GAN 在一次性中文字体生成基准上取得最优FID分数17.94,显著优于像素级(51.44)、字符级(33.21)和基线方法(49.09)的监督方式。
- 组件级监督使SSIM提升至0.7568,同时将RMSE降低至0.0218,LPIPS降低至0.2058,表明图像质量与结构保真度显著提升。
- 消融实验表明,三种组件级损失——结构保留、风格匹配与真实感——均对性能有显著贡献,且各阶段均实现增量提升。
- 该框架在未见风格与未登录字符上泛化良好,在OOV-U上FID为113.01,在IV-U上为110.07,优于先前方法在这些挑战性设置下的表现。
- 场景文本编辑的视觉结果表明,CG-GAN无需多阶段渲染即可生成高质量、逼真的编辑结果,有效减少前景-背景干扰。
- 该方法在与写作者无关的手写生成任务中表现强劲,FID达19.03,优于HiGAN(17.28)与ScrabbleGAN(23.78),表明其对多样化文本风格具有强大泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。