Skip to main content
QUICK REVIEW

[论文解读] TESS: Text-to-Text Self-Conditioned Simplex Diffusion

Rabeeh Karimi Mahabadi, Hamish Ivison|arXiv (Cornell University)|May 15, 2023
Topic Modeling被引用 4
一句话总结

TESS 提出了一种完全非自回归的文本扩散模型,直接在 logits 单形空间中进行扩散,并采用一种新颖的自条件机制以提升生成质量。该模型在摘要生成、复述生成、文本简化和问题生成任务上均优于当前最先进(SOTA)的非自回归与基于扩散的模型,其性能可与强大的自回归模型(如 BART)相媲美。

ABSTRACT

Diffusion models have emerged as a powerful paradigm for generation, obtaining strong performance in various continuous domains. However, applying continuous diffusion models to natural language remains challenging due to its discrete nature and the need for a large number of diffusion steps to generate text, making diffusion-based generation expensive. In this work, we propose Text-to-text Self-conditioned Simplex Diffusion (TESS), a text diffusion model that is fully non-autoregressive, employs a new form of self-conditioning, and applies the diffusion process on the logit simplex space rather than the learned embedding space. Through extensive experiments on natural language understanding and generation tasks including summarization, text simplification, paraphrase generation, and question generation, we demonstrate that TESS outperforms state-of-the-art non-autoregressive models, requires fewer diffusion steps with minimal drop in performance, and is competitive with pretrained autoregressive sequence-to-sequence models. We publicly release our codebase at https://github.com/allenai/tess-diffusion.

研究动机与目标

  • 为解决将扩散模型应用于离散自然语言时面临的挑战,避免使用自回归生成与嵌入空间依赖性。
  • 通过在 logits 单形空间上引入一种新颖的自条件机制,提升非自回归设置下的文本生成质量。
  • 证明在概率单形空间上直接进行扩散可实现灵活、全局的序列生成,且无需分块约束。
  • 在包括生成与理解在内的多样化 NLP 任务上评估该模型,展示其与强大自回归基线模型相比具有竞争力的性能。
  • 发布训练好的模型与代码,以推动基于扩散的文本生成领域的开放研究。

提出的方法

  • TESS 在词汇 logits 空间(即单形空间)中直接进行扩散,避免使用学习得到的嵌入,从而实现对离散 token 的端到端训练。
  • 其采用一种新颖的自条件机制,利用单形空间的几何语义特性,以提升去噪准确率与生成质量。
  • 模型使用标准的扩散训练目标:通过 U-Net 架构对添加到 logits 向量中的噪声进行去噪,并建模噪声调度与反向过程。
  • 在推理阶段,通过将反向去噪过程基于当前序列状态进行自条件化,提升生成结果的连贯性与流畅性。
  • 该方法从 RoBERTa 检查点端到端进行训练,微调下游任务时无需额外预训练。
  • 推理阶段使用 1000 次采样步骤进行生成,10 次用于分类,单形缩放超参数 $k=5$。

实验结果

研究问题

  • RQ1完全非自回归的扩散模型是否能在不依赖自回归生成的前提下,实现自然语言生成任务的竞争力表现?
  • RQ2与标准自条件化或无条件化相比,在 logits 单形空间上的自条件化是否能提升生成质量?
  • RQ3与嵌入空间或其它潜在空间中的扩散相比,直接在概率单形空间上进行扩散是否在质量与灵活性方面更具优势?
  • RQ4TESS 在多样化的 NLG 与 NLU 任务上与强大的自回归模型(如 BART)相比表现如何?
  • RQ5所提出的基于单形空间的扩散框架是否能在包括摘要生成、复述生成与文本简化在内的多个 NLP 任务上实现良好泛化?

主要发现

  • 在复述生成任务中,TESS 超过所有非自回归与基于扩散的基线模型,BLEU、BERTScore 与 ROUGE-L 分数均更高。
  • 在摘要生成任务中,TESS 达到了与 BART 相当的 ROUGE-L F1 分数,尽管未使用 BART 的预训练目标。
  • 在文本简化任务中,TESS 的 SARI 分数显著高于先前的扩散模型,且与强大的自回归模型相比具有竞争力。
  • 在问题生成任务中,TESS 在质量与多样性指标上均超越所有非自回归与基于扩散的基线模型。
  • 在 GLUE 基准上,TESS 表现与强大的掩码语言模型相当,展示了在自然语言理解任务中出色的零样本与少样本能力。
  • 所提出的基于单形空间的自条件化方法在所有评估任务中均显著提升了生成质量,验证结果可靠。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。