Skip to main content
QUICK REVIEW

[论文解读] GlyphDiffusion: Text Generation as Image Generation

Junyi Li, Wayne Xin Zhao|arXiv (Cornell University)|Apr 25, 2023
Multimodal Machine Learning Applications被引用 4
一句话总结

GlyphDiffusion 提出了一种新颖的文本生成框架,通过将目标文本渲染为高保真度的字形图像,将条件化文本生成任务视为文本引导的图像生成任务。通过在这些视觉表示上应用连续扩散模型,并引入文本定位模块,该方法在条件化文本生成任务上实现了最先进性能,优于自回归与非自回归模型以及先前的基于扩散的方法。

ABSTRACT

Diffusion models have become a new generative paradigm for text generation. Considering the discrete categorical nature of text, in this paper, we propose GlyphDiffusion, a novel diffusion approach for text generation via text-guided image generation. Our key idea is to render the target text as a glyph image containing visual language content. In this way, conditional text generation can be cast as a glyph image generation task, and it is then natural to apply continuous diffusion models to discrete texts. Specially, we utilize a cascaded architecture (ie a base and a super-resolution diffusion model) to generate high-fidelity glyph images, conditioned on the input text. Furthermore, we design a text grounding module to transform and refine the visual language content from generated glyph images into the final texts. In experiments over four conditional text generation tasks and two classes of metrics (ie quality and diversity), GlyphDiffusion can achieve comparable or even better results than several baselines, including pretrained language models. Our model also makes significant improvements compared to the recent diffusion model.

研究动机与目标

  • 为解决将连续扩散模型适配到离散文本生成的挑战,该挑战受制于标记的固有类别性质。
  • 通过使用固定视觉目标(字形图像)而非学习动态连续表示,克服扩散模型在文本生成中训练不稳定的难题。
  • 通过利用级联扩散模型在渲染文本图像上的强大图像生成能力,提升文本生成的质量与多样性。
  • 通过一种新颖的图像到文本优化流水线,弥合视觉基扩散模型与自然语言生成之间的差距。

提出的方法

  • 将目标文本渲染为字形图像,将离散文本生成转化为连续图像生成任务。
  • 采用带有基础模型与超分辨率模型的级联扩散架构,以生成高保真度字形图像。
  • 使用基于冻结 T5 编码文本嵌入的无分类器指导,提升生成字形图像的内容保真度。
  • 引入文本定位模块,将生成字形图像中的视觉语言内容提炼为连贯的最终文本输出。
  • 在固定字形图像目标上训练扩散模型,以稳定去噪损失并避免训练过程中的分布偏移。
  • 利用冻结的 T5 模型编码输入语义,确保图像生成的一致且有意义的条件输入。

实验结果

研究问题

  • RQ1能否通过渲染字形图像,将文本生成有效重构为条件化图像生成任务?
  • RQ2与学习连续表示相比,使用固定视觉目标(字形图像)是否能稳定扩散模型在离散序列上的训练?
  • RQ3结合无分类器指导的级联扩散模型能否生成保留语义与句法准确性的高保真度字形图像?
  • RQ4与直接的图像到文本解码相比,文本定位模块在多大程度上提升了生成文本的质量与流畅性?
  • RQ5GlyphDiffusion 在质量与多样性方面,相较于自回归、非自回归以及先前基于扩散的文本生成模型表现如何?

主要发现

  • 在条件化文本生成任务上,GlyphDiffusion 相较于自回归与非自回归基线模型,BLEU 与 ROUGE-L 分数提升超过 50%。
  • 在 Quasar-T 数据集上,GlyphDiffusion 相较于先前最先进扩散模型,BLEU 分数提升 +2.54 分。
  • 在 GYAFC 数据集上,其 Diverse-4 分数提升 +2.24,表明生成多样性更优。
  • 在所有四项评估的条件化文本生成任务中,该模型均优于强大的自回归与非自回归模型。
  • 消融实验表明,移除文本定位模块会导致生成质量显著下降,证实其关键作用。
  • 使用固定字形图像目标可防止去噪损失崩溃,从而实现连续扩散模型在离散文本上的稳定训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。