Skip to main content
QUICK REVIEW

[论文解读] Style Transformer: Unpaired Text Style Transfer without Disentangled Latent Representation

Ning Dai, Jianze Liang|arXiv (Cornell University)|May 14, 2019
Topic Modeling参考文献 29被引用 11
一句话总结

本文提出Style Transformer,一种新颖的文本风格迁移模型,通过利用Transformer的自注意力机制,绕过解耦的潜在表征。与依赖对抗性解耦的先前方法不同,该模型通过注意力增强的编码器-解码器架构直接迁移风格,同时保留内容,在两个基准数据集上实现了最先进水平的内容保留效果。

ABSTRACT

Disentangling the content and style in the latent space is prevalent in unpaired text style transfer. However, two major issues exist in most of the current neural models. 1) It is difficult to completely strip the style information from the semantics for a sentence. 2) The recurrent neural network (RNN) based encoder and decoder, mediated by the latent representation, cannot well deal with the issue of the long-term dependency, resulting in poor preservation of non-stylistic semantic content. In this paper, we propose the Style Transformer, which makes no assumption about the latent representation of source sentence and equips the power of attention mechanism in Transformer to achieve better style transfer and better content preservation.

研究动机与目标

  • 为解决无配对文本风格迁移中解耦潜在表征的局限性,特别是内容保留效果差以及难以捕捉长距离依赖关系的问题。
  • 消除对抗性训练以强制实现内容与风格解耦的需求,此类方法往往无法完全去除内容表征中的风格信息。
  • 通过利用Transformer架构的完整上下文建模能力,而非固定大小的潜在向量,来提升内容保留效果。
  • 通过允许解码器通过自注意力机制关注完整输入序列,而非依赖压缩的潜在代码,实现更有效的风格迁移。
  • 证明端到端训练的注意力机制模型可超越需要显式解耦内容与风格的模型。

提出的方法

  • 提出一种基于Transformer的编码器-解码器架构,直接使用多头自注意力机制建模输入和输出序列,避免使用固定大小的潜在向量。
  • 采用一种新颖的训练目标,结合自重建、循环重建和对抗性损失,实现在无需解耦情况下的内容保留与风格控制。
  • 使用判别器对真实句子与生成句子的混合样本进行训练,以提供风格监督并防止模式崩溃。
  • 引入循环重建损失,通过在风格迁移后进行反向迁移以重建原始输入,来鼓励模型保留语义内容。
  • 应用自重建损失,以确保模型能够从输入生成流畅且连贯的句子。
  • 在编码器和解码器中均使用多头注意力机制,以捕捉长距离依赖关系并提升上下文建模能力。

实验结果

研究问题

  • RQ1基于Transformer的模型是否能在不依赖解耦潜在表征的情况下,实现无配对文本风格迁移中的更好内容保留?
  • RQ2与使用固定大小潜在码的RNN模型相比,自注意力机制和解码器中的全序列注意力是否能显著提升内容保留效果?
  • RQ3自重建、循环重建和对抗性损失等不同训练组件如何影响模型性能与稳定性?
  • RQ4在未显式解耦内容与风格的情况下,模型是否仍能实现高质量的风格迁移与内容保留?
  • RQ5在判别器训练中,真实样本与生成样本的相对贡献如何?

主要发现

  • Style Transformer在Yelp和Amazon数据集上均实现了最高水平的内容保留性能,多类别设置下的BLEU得分为20.3,条件设置下为17.1。
  • 该模型在内容保留方面显著优于先前的最先进方法,证明了避免使用解耦潜在表征的有效性。
  • 消融实验表明,若移除循环重建损失,BLEU得分将大幅下降(从20.3降至8.7),证实其在保留输入语义方面具有关键作用。
  • 判别器损失至关重要:若无该损失,模型会退化为复制输入句子,风格准确率仅3.3%。
  • 仅使用真实句子进行判别器训练会导致风格控制效果差(准确率20.7%),而仅使用生成样本则能维持合理性能,表明生成样本在风格监督中至关重要。
  • 自重建损失对生成流畅输出至关重要;若禁用该损失,模型会退化为仅生成单个词。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。