Skip to main content
QUICK REVIEW

[论文解读] VAE based Text Style Transfer with Pivot Words Enhancement Learning

Haoran Xu, Sixing Lu|arXiv (Cornell University)|Dec 6, 2021
Speech Recognition and Synthesis被引用 5
一句话总结

本文提出 VT-STOWER,一种基于变分自编码器(VAE)的文本风格迁移模型,通过变分自编码器联合学习内容与风格分布,并结合外部风格嵌入,引入一种新颖的枢纽词掩码机制以提升风格迁移的准确性。该方法通过可学习权重实现灵活的风格强度控制,在情感、正式程度及语言混用迁移任务中均达到最先进性能,首次将风格迁移应用于印地语-印地英语混用(Hindi-Hinglish)语言混用场景。

ABSTRACT

Text Style Transfer (TST) aims to alter the underlying style of the source text to another specific style while keeping the same content. Due to the scarcity of high-quality parallel training data, unsupervised learning has become a trending direction for TST tasks. In this paper, we propose a novel VAE based Text Style Transfer with pivOt Words Enhancement leaRning (VT-STOWER) method which utilizes Variational AutoEncoder (VAE) and external style embeddings to learn semantics and style distribution jointly. Additionally, we introduce pivot words learning, which is applied to learn decisive words for a specific style and thereby further improve the overall performance of the style transfer. The proposed VT-STOWER can be scaled to different TST scenarios given very limited and non-parallel training data with a novel and flexible style strength control mechanism. Experiments demonstrate that the VT-STOWER outperforms the state-of-the-art on sentiment, formality, and code-switching TST tasks.

研究动机与目标

  • 通过利用变分自编码器与外部风格嵌入的无监督学习方法,解决低资源、非平行文本风格迁移的挑战。
  • 通过引入枢纽词掩码机制,突出对风格迁移起决定性作用的词语,以提升风格迁移的准确性。
  • 通过可调节的风格权重实现对风格强度的灵活控制,适应多样化的文本风格迁移(TST)场景。
  • 将文本风格迁移扩展至尚未充分探索的语言混用任务,特别是印地语-印地英语混用,采用统一框架实现。
  • 在低资源数据集上展示模型的泛化能力与鲁棒性,尤其在保持流畅性的同时实现高迁移准确率。

提出的方法

  • VT-STOWER 采用两阶段训练流程:首先在内容重建任务上预训练变分自编码器,随后通过风格感知目标进行微调。
  • 模型利用变分自编码器学习内容与风格的连续且解耦的潜在空间,支持平滑插值与生成。
  • 使用外部风格嵌入表示目标风格,使模型能够基于特定风格属性进行条件生成。
  • 引入枢纽词掩码机制,通过 BERT 注意力头计算的重要性分数,识别对风格起决定作用的词语,以增强学习效果。
  • 风格强度通过潜在空间中的可学习权重 $ w $ 控制,该权重调节目标风格嵌入对潜在向量 $ z' $ 的贡献。
  • 模型训练包含重建损失、内容重建损失与风格重建损失,其中枢纽词重要性分数用于引导训练过程中的注意力机制。

实验结果

研究问题

  • RQ1基于变分自编码器的框架是否能在仅依赖极少平行数据的情况下,联合建模文本风格迁移中的内容与风格分布?
  • RQ2枢纽词掩码机制如何在不依赖平行训练对的情况下,提升文本风格迁移的准确率与流畅性?
  • RQ3潜在空间中的可学习权重参数在多大程度上可实现对风格强度的灵活控制?
  • RQ4所提方法是否能泛化至低资源、非平行的风格迁移任务(如语言混用)?
  • RQ5与最先进方法相比,该模型在情感与正式程度迁移等基准任务上的表现如何?

主要发现

  • 在情感迁移任务中,VT-STOWER 在风格权重为 2.5 时达到 95.9% 的迁移准确率,显著优于先前方法。
  • 在高风格强度下,模型仍保持合理的 BLEU 得分(20.85)与 PPL(32.8),表明在准确率与流畅性之间取得良好平衡。
  • 在语言混用迁移任务中,VT-STOWER 达到 87.4% 的准确率与 15.6 的 BLEU 得分,显著优于随机替换基线(1.02% 准确率)与基于 MUSE 的翻译方法。
  • 枢纽词掩码机制通过聚焦关键风格决定性词语(如情感迁移中的 'comfortable and welcome',正式程度迁移中的 'ur')提升了迁移准确率。
  • 重要性分数分析表明,模型能够学习关注具有高风格意义的词语,如非正式代词或语言混用内容。
  • 模型在低资源设置下表现出良好泛化能力,即使在仅 7K 条句子的混用数据集上也实现了优异性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。