Skip to main content
QUICK REVIEW

[论文解读] Domain Adaptive Text Style Transfer

Dianqi Li, Yizhe Zhang|arXiv (Cornell University)|Aug 25, 2019
Music and Audio Processing参考文献 39被引用 10
一句话总结

本文提出领域自适应文本风格迁移(DAST),一种利用大规模源域数据提升低资源目标域文本风格迁移性能的方法。通过可学习的领域向量与领域特定的风格分类器,实现通用内容与领域特异性风格的解耦,即使在目标域数据不足1%的情况下,仍能实现优越的内容保留与风格迁移准确率,在情感与正式度迁移任务中均优于基线模型。

ABSTRACT

Text style transfer without parallel data has achieved some practical success. However, in the scenario where less data is available, these methods may yield poor performance. In this paper, we examine domain adaptation for text style transfer to leverage massively available data from other domains. These data may demonstrate domain shift, which impedes the benefits of utilizing such data for training. To address this challenge, we propose simple yet effective domain adaptive text style transfer models, enabling domain-adaptive information exchange. The proposed models presumably learn from the source domain to: (i) distinguish stylized information and generic content information; (ii) maximally preserve content information; and (iii) adaptively transfer the styles in a domain-aware manner. We evaluate the proposed models on two style transfer tasks (sentiment and formality) over multiple target domains where only limited non-parallel data is available. Extensive experiments demonstrate the effectiveness of the proposed model compared to the baselines.

研究动机与目标

  • 解决在目标域数据稀缺且与源域分布存在差异时,文本风格迁移性能不佳的问题。
  • 通过利用相关但不同的源域中大规模、非平行的数据,实现在低资源目标域中的有效风格迁移。
  • 将通用内容信息与领域特异性风格特征解耦,以在保留内容的同时适应目标域的词汇模式。
  • 设计一种模型,实现领域自适应的信息交换,在数据稀缺条件下保持高风格迁移准确率与内容保真度。

提出的方法

  • 模型采用变分自编码器框架,设置独立的内容与风格潜在空间,以实现通用内容与领域特异性风格的解耦。
  • 引入可学习的领域向量,以目标领域条件控制生成过程,实现领域感知的风格迁移。
  • 使用领域特定的风格分类器,引导模型学习各领域的独特风格模式,提升风格控制能力。
  • 训练目标结合自编码损失、风格迁移损失与领域特定风格分类损失,联合优化内容保留与领域适应。
  • 在存在平行源数据的设置中(如GYAFC),对源域应用额外的序列到序列损失,以增强风格迁移的监督信号。
  • 模型端到端地使用源域与目标域数据进行训练,其中源域提供通用内容知识,目标域提供风格与领域特定的监督信号。

实验结果

研究问题

  • RQ1利用大规模源域数据能否提升在低资源目标域中的文本风格迁移性能?
  • RQ2当存在领域分布偏移时,模型如何有效解耦通用内容与领域特异性风格?
  • RQ3在数据稀缺条件下,哪些组件对于维持高内容保留与风格迁移准确率至关重要?
  • RQ4能否在无需目标域平行数据的情况下实现领域自适应的信息交换?

主要发现

  • 在Yelp情感迁移任务中,DAST仅使用0.1%的目标数据(400个样本)即达到4.8的G-score,显著优于基线模型与微调模型。
  • 在Enron正式度迁移任务中,DAST即使在非平行目标数据下,仍保持88.4%的领域准确率与91.6%的风格准确率。
  • 消融实验表明,领域向量对领域准确率贡献最大,而领域特定风格分类器对风格控制与内容保留至关重要。
  • DAST在内容保留(更高G-score)与风格控制(更高S-acc)方面均优于微调方法,避免了灾难性遗忘。
  • 在存在平行源数据(GYAFC)的情况下,DAST在Enron正式度任务上的人工偏好得分为81.2,显著高于次优方法。
  • 即使仅使用400个目标样本(0.1%),DAST仍能生成连贯且风格一致的句子,而仅使用目标域的基线模型则生成了无意义文本。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。