Skip to main content
QUICK REVIEW

[论文解读] IMaT: Unsupervised Text Attribute Transfer via Iterative Matching and Translation

Zhijing Jin, Di Jin|arXiv (Cornell University)|Jan 31, 2019
Topic Modeling被引用 9
一句话总结

IMaT 提出了一种简单而有效的无监督文本属性迁移框架,通过迭代句对匹配和序列到序列翻译构建伪平行语料库,并在多轮翻译步骤中不断优化对齐。该方法在情感和正式度迁移任务中达到最先进性能,优于复杂的 GAN 基模型和启发式方法,在内容保留、流畅度和属性准确率方面表现更优。

ABSTRACT

Text attribute transfer aims to automatically rewrite sentences such that they possess certain linguistic attributes, while simultaneously preserving their semantic content. This task remains challenging due to a lack of supervised parallel data. Existing approaches try to explicitly disentangle content and attribute information, but this is difficult and often results in poor content-preservation and ungrammaticality. In contrast, we propose a simpler approach, Iterative Matching and Translation (IMaT), which: (1) constructs a pseudo-parallel corpus by aligning a subset of semantically similar sentences from the source and the target corpora; (2) applies a standard sequence-to-sequence model to learn the attribute transfer; (3) iteratively improves the learned transfer function by refining imperfections in the alignment. In sentiment modification and formality transfer tasks, our method outperforms complex state-of-the-art systems by a large margin. As an auxiliary contribution, we produce a publicly-available test set with human-generated transfer references.

研究动机与目标

  • 解决在无并行训练数据可用情况下的无监督文本属性迁移挑战。
  • 克服现有基于解耦模型在内容保留差和语法不自然方面的局限性。
  • 开发一种稳健的端到端框架,避免使用复杂架构或基于规则的启发式方法。
  • 通过迭代优化伪并行句子对齐,提升迁移质量。
  • 提供一个公开的人工标注的测试集,用于情感迁移任务,以支持更可靠评估。

提出的方法

  • 通过匹配源语料和目标语料中具有不同属性的语义相似句子,构建初始伪并行语料库。
  • 在伪并行语料库上训练标准的序列到序列(Seq2Seq)模型,以学习属性迁移。
  • 通过用前一轮迭代中模型生成的翻译结果替换旧的句子对,迭代优化伪并行语料库。
  • 使用内容相似度度量(WMD)验证更新结果,仅接受能降低原始句子与翻译句子之间内容偏移的更新。
  • 重复执行匹配-翻译-优化循环,直至性能趋于稳定,从而随时间逐步提升对齐质量。
  • 利用 Seq2Seq 模型的去噪能力,纠正初始匹配质量较低的句子对,而无需依赖完美的初始对齐。

实验结果

研究问题

  • RQ1在弱监督的伪并行语料库上训练的简单 Seq2Seq 模型,是否能优于复杂的基于解耦的模型?
  • RQ2对伪并行对齐进行迭代优化,在多大程度上能提升迁移输出的内容保留与流畅度?
  • RQ3该方法对低质量初始句子匹配的鲁棒性如何?是否仍优于更强的基线模型?
  • RQ4迭代翻译过程能否有效去噪并纠正初始伪对中的错误?
  • RQ5该方法在不同属性迁移任务(如情感和正式度迁移)中是否具有泛化能力?

主要发现

  • IMaT 在自动评估和人工评估中均优于最先进模型,包括 GAN 基方法(Shen et al., 2017;Fu et al., 2018)和启发式方法(Li et al., 2018)。
  • 在第一次翻译步骤后,YELP 数据集上初始质量较差的匹配 BLEU 分数从 9.40 提升至 13.18,FORMALITY 数据集上从 5.44 提升至 28.25,表明其具备强大的去噪能力。
  • 经过迭代优化后,BLEU 分数在各轮迭代中持续上升,表明内容保留能力持续增强。
  • 即使在 FORMALITY 数据集中仅有 52% 的最终伪对与真实并行对匹配,IMaT 仍取得更优性能,显示出对噪声初始对齐的高容忍度。
  • 人工评估确认,IMaT 生成的输出在内容保留方面优于竞争模型,避免了语法错误,并正确实现了目标属性的迁移。
  • 情感迁移任务中公开发布了一个包含 800 个样本的人工标注测试集,为未来属性迁移系统提供了更丰富、更可靠的评估基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。