Skip to main content
QUICK REVIEW

[论文解读] Reinforcement Learning Based Text Style Transfer without Parallel Training Corpus

Hongyu Gong, Suma Bhat|arXiv (Cornell University)|Mar 26, 2019
Topic Modeling参考文献 38被引用 9
一句话总结

本文提出了一种基于强化学习的文本风格迁移模型,该模型无需并行训练语料,通过生成器-评估器框架实现,结合对抗性风格判别、词移距离(WMD)进行语义相似性计算,以及语言模型进行流畅性评估。该方法在情感迁移与正式度迁移任务中均取得了最先进性能,通过端到端强化学习优化,结合多样化的评估指标,在内容保留、风格迁移强度和流畅性方面优于先前方法。

ABSTRACT

Text style transfer rephrases a text from a source style (e.g., informal) to a target style (e.g., formal) while keeping its original meaning. Despite the success existing works have achieved using a parallel corpus for the two styles, transferring text style has proven significantly more challenging when there is no parallel training corpus. In this paper, we address this challenge by using a reinforcement-learning-based generator-evaluator architecture. Our generator employs an attention-based encoder-decoder to transfer a sentence from the source style to the target style. Our evaluator is an adversarially trained style discriminator with semantic and syntactic constraints that score the generated sentence for style, meaning preservation, and fluency. Experimental results on two different style transfer tasks (sentiment transfer and formality transfer) show that our model outperforms state-of-the-art approaches. Furthermore, we perform a manual evaluation that demonstrates the effectiveness of the proposed method using subjective metrics of generated text quality.

研究动机与目标

  • 解决在缺乏并行训练语料的情况下文本风格迁移的挑战。
  • 在不依赖可微分损失函数的前提下,提升风格迁移中的内容保留、风格迁移强度与流畅性。
  • 通过强化学习,将非可微分评估指标(如语义相似性与流畅性)有效整合进训练目标。
  • 开发一种灵活的框架,将风格、语义与流畅性等多种约束模块统一整合至统一的训练流程中。

提出的方法

  • 生成器为基于注意力的序列到序列模型,将源风格句子转换为目标风格。
  • 评估器由三部分组成:通过对抗训练分类目标风格句子的风格判别器、用于语义相似性的词移距离(WMD)模块,以及用于流畅性评分的语言模型。
  • 强化学习利用评估器得分生成的奖励更新生成器,实现对非可微分指标的优化。
  • 风格判别器通过对抗训练,以区分真实目标风格句子与生成句子,提升风格分类的鲁棒性与准确性。
  • 通过WMD强制实现语义保留,该方法在无需并行数据的前提下计算源句与生成句之间的语义相似性。
  • 流畅性通过预训练语言模型评估,该模型对生成句子的语法与句法质量进行打分。

实验结果

研究问题

  • RQ1强化学习框架能否在无并行训练语料的情况下有效实现文本风格迁移?
  • RQ2在无并行样本的情况下,模型在风格迁移过程中对语义内容的保留能力如何?
  • RQ3非可微分评估指标(如WMD与语言模型得分)能否被有效整合进风格迁移的训练目标?
  • RQ4与现有方法相比,该方法在内容保留、迁移强度与流畅性方面表现如何?

主要发现

  • 在情感迁移任务中,所提模型取得了最高综合得分,平衡了内容保留与风格迁移强度,优于交叉注意力(CA)与多解码器序列到序列(MDS)基线模型。
  • 在正式度迁移任务中,模型取得了最佳综合得分与最低困惑度,展现出在内容保留、迁移强度与流畅性方面的卓越性能。
  • 非正式到正式的迁移方向显著难于反向迁移,可能由于非正式文本中存在更多多样性与拼写错误。
  • 人工评估确认,模型生成的句子在内容相似性、风格迁移强度与流畅性方面均获得高分,平均分超过6分制的4.5分。
  • 该模型成功应用了多种改写策略,包括词汇替换、词语删除、词语插入与结构变化,以实现风格迁移。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。