Skip to main content
QUICK REVIEW

[论文解读] Label Dependent Deep Variational Paraphrase Generation

Siamak Shakeri, Abhinav Sethy|arXiv (Cornell University)|Nov 27, 2019
Topic Modeling参考文献 11被引用 4
一句话总结

该论文提出了一种基于标签的深度变分自编码器(DVPG),用于释义生成,通过条件化二元标签(表示语义相似性)来提升生成多样性与性能,相较于基线变分自编码器(VAE)和序列到序列(seq2seq)模型表现更优。该模型通过引入标签感知的潜在空间建模与优化训练策略,在Quora和微软研究院释义数据集上取得了当前最优结果。

ABSTRACT

Generating paraphrases that are lexically similar but semantically different is a challenging task. Paraphrases of this form can be used to augment data sets for various NLP tasks such as machine reading comprehension and question answering with non-trivial negative examples. In this article, we propose a deep variational model to generate paraphrases conditioned on a label that specifies whether the paraphrases are semantically related or not. We also present new training recipes and KL regularization techniques that improve the performance of variational paraphrasing models. Our proposed model demonstrates promising results in enhancing the generative power of the model by employing label-dependent generation on paraphrasing datasets.

研究动机与目标

  • 为解决在自然语言处理任务中进行数据增强时,生成词汇多样但语义不同的释义所面临的挑战。
  • 探究在生成过程中引入二元标签(语义相似性)是否能提升模型性能与多样性。
  • 开发一种条件变分自编码器,以在释义生成中建模标签依赖的分布。
  • 通过新颖的采样与KL正则化调度策略,提升训练稳定性与生成质量。

提出的方法

  • 提出一种基于条件变分自编码器(CVAE)的深度释义生成(DVPG)模型,其中潜在变量 z 条件于标签 v。
  • 推导出一种证据下界(ELBO),引入标签依赖先验 p(z|v),以提升对带标签释义数据的密度估计性能。
  • 采用两步训练策略:首先仅使用交叉熵损失进行6轮预训练,随后逐步引入KL正则化以稳定训练过程。
  • 在推理阶段使用多组采样(最多20组)评估生成多样性与模型容量。
  • 应用标签感知的KL正则化与损失加权策略(如Loss 2 Type IV),以平衡重建损失与先验对齐。
  • 将先验 p(z|v) 建模为高斯混合模型(GMM),每个分量对应一个标签类别(如0或1),以实现解耦的潜在表征。

实验结果

研究问题

  • RQ1将潜在空间条件化于二元标签(语义相似性)是否能提升释义模型的生成质量与多样性?
  • RQ2与标准VAE相比,标签依赖建模如何影响变分自编码器在释义生成中的性能表现?
  • RQ3何种训练调度与正则化技术能最大化标签条件化变分模型的生成能力?
  • RQ4引入标签信息是否能同时提升在相同与非相同释义生成任务上的性能表现?

主要发现

  • 在Quora问题对数据集上,DVPG模型优于非变分seq2seq与普通VAE基线模型,Max-BLEU指标实现0.95%的绝对提升。
  • 在微软研究院释义数据集上,DVPG相较于VAE基线模型,Min-TER提升0.22%,Max-BLEU提升0.95%。
  • 当使用10组或以上变分采样时,模型的生成能力趋于饱和,进一步增加采样数仅带来边际收益(例如,从10组到20组仅提升1.4个BLEU点)。
  • 两步训练策略——先仅使用交叉熵损失训练,随后逐步引入KL正则化——相比标准KL退火策略,能获得更优性能。
  • 在较小数据集(如微软研究院数据集)上,更强正则化的KL损失(如Loss 2 Type IV)优于较弱正则化的变体,表明小样本数据需要更强正则化。
  • 尽管生成多样性提升,平均性能指标的下降幅度小于最优指标,表明生成的释义仍与标准参考答案保持接近,同时具备多样性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。