[论文解读] A Probabilistic Formulation of Unsupervised Text Style Transfer
本论文提出一种用于无监督文本风格转换的深潜在序列模型,将非并行语料视为部分观测的并行语料,利用平滑变分推断训练带语言模型先验的编码器-解码器系统,在多种风格转换任务中达到最先进的结果,并在无监督机器翻译方面具有竞争力。
We present a deep generative model for unsupervised text style transfer that unifies previously proposed non-generative techniques. Our probabilistic approach models non-parallel data from two domains as a partially observed parallel corpus. By hypothesizing a parallel latent sequence that generates each observed sequence, our model learns to transform sequences from one domain to another in a completely unsupervised fashion. In contrast with traditional generative sequence models (e.g. the HMM), our model makes few assumptions about the data it generates: it uses a recurrent language model as a prior and an encoder-decoder as a transduction distribution. While computation of marginal data likelihood is intractable in this model class, we show that amortized variational inference admits a practical surrogate. Further, by drawing connections between our variational objective and other recent unsupervised style transfer and machine translation techniques, we show how our probabilistic view can unify some known non-generative objectives such as backtranslation and adversarial loss. Finally, we demonstrate the effectiveness of our method on a wide range of unsupervised style transfer tasks, including sentiment transfer, formality transfer, word decipherment, author imitation, and related language translation. Across all style transfer tasks, our approach yields substantial gains over state-of-the-art non-generative baselines, including the state-of-the-art unsupervised machine translation techniques that our approach generalizes. Further, we conduct experiments on a standard unsupervised machine translation task and find that our unified approach matches the current state-of-the-art.
研究动机与目标
- 为无监督文本风格转换提出一个有原理的概率方法,统一现有的非生成方法。
- 将来自两个领域的非并行语料视为部分观测的并行语料,以实现跨域转写的学习。
- 开发一个带预训练语言模型先验的编码器-解码器转写模型,并使用放大变分推断来优化一个可处理的代理目标(ELBO)。
- 研究概率目标与回译/对抗式目标之间的联系,并在多样的风格转移任务上评估性能。
- 证明所提出的方法在许多非生成基线上获得显著提升,并在相关任务上的无监督MT基线达到或超过。
提出的方法
- 为双语文本定义一个深潜在序列模型,通过潜在并行句子将领域连接。
- 使用两个转写分布 p(x|bar{y}) 和 p(y|bar{x}),由编码器-解码器模块参数化,并具备领域特定的预训练语言先验。
- 应用放大变分推断以最大化 ELBO,推断网络 q(bar{y}|x) 与 q(bar{x}|y) 与生成模型共享参数。
- 在两个转移方向之间绑定参数,并加入域嵌入机制以指定转移方向。
- 通过随机梯度估计来处理不可处理的边际似然(对潜变量重构使用停止梯度的方法),在需要时使用 Gumbel-Softmax 或 REINFORCE 变体,并在重构时偏好贪心解码。
- 初始化使用自重构损失以稳定早期训练并防止陷入差的局部最优。
实验结果
研究问题
- RQ1一个完全概率的表述是否能够统一并改进现有非生成方法的无监督文本风格转移?
- RQ2带潜在双语文本的放大变分推断是否提供一个在训练跨域文本转写模型时实用且有效的目标函数?
- RQ3在情感、正式度、作者模仿、破译以及相关语言翻译等方面,该模型与现有最先进的无监督风格转换和无监督机器翻译基线相比如何?
- RQ4参数共享、梯度传播策略和熵正则化对模型性能的影响是什么?
- RQ5统一的概率观点是否能够在标准无监督 MT 基准测试中获得有竞争力的结果?
主要发现
- 所提出的方法在情感、正式度、作者模仿和破译等任务上,相较于强大的非生成基线,取得更高的参考BLEU。
- 在无监督MT基准中,该方法达到或超过当前最先进的非生成系统。
- KL项中的基于熵的正则化可以通过防止退化的过度自信转写来提升性能。
- 两种转移方向之间的参数共享和共享编码器提高稳定性和结果;移除共享会严重退化输出。
- 对潜变量的贪心梯度估计在偏差-方差权衡上具有优势,在此场景中优于更复杂的梯度估计器。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。