Skip to main content
QUICK REVIEW

[论文解读] Learning Criteria and Evaluation Metrics for Textual Transfer between Non-Parallel Corpora.

Yuanzhe Pang, Kevin Gimpel|arXiv (Cornell University)|Oct 28, 2018
Natural Language Processing Techniques参考文献 32被引用 4
一句话总结

本文提出了一种无需平行语料的文本转换多指标评估框架及其相应的损失函数,重点关注语义保留、流畅度和分类准确率。通过结合循环一致性损失与基于释义的损失以实现内容保留,以及使用风格特定的语言模型以提升流畅度,该方法在自动评估和人工评估中均显著优于先前工作。

ABSTRACT

We consider the problem of automatically generating textual paraphrases with modified attributes or stylistic properties, focusing on the setting without parallel data (Hu et al., 2017; Shen et al., 2017). This setting poses challenges for learning and evaluation. We show that the metric of post-transfer classification accuracy is insufficient on its own, and propose additional metrics based on semantic content preservation and fluency. For reliable evaluation, all three metric categories must be taken into account. We contribute new loss functions and training strategies to address the new metrics. Semantic preservation is addressed by adding a cyclic consistency loss and a loss based on paraphrase pairs, while fluency is improved by integrating losses based on style-specific language models. Automatic and manual evaluation show large improvements over the baseline method of Shen et al. (2017). Our hope is that these losses and metrics can be general and useful tools for a range of textual transfer settings without parallel corpora.

研究动机与目标

  • 解决缺乏可靠评估指标的问题,以评估无平行语料的文本转换任务。
  • 在无平行数据的情况下,提升生成释义的语义内容保留与流畅度。
  • 开发与所提评估指标相一致的训练策略。
  • 提供可广泛应用于多种文本转换场景的通用损失函数与评估工具。

提出的方法

  • 引入循环一致性损失,以在属性转换过程中强制保持语义保留。
  • 采用基于释义对的损失,进一步强化内容保留。
  • 整合风格特定的语言模型,以提升生成文本的流畅度。
  • 将这些损失与后处理分类准确率目标结合,实现端到端训练。
  • 设计一种联合优化语义保真度、流畅度与转换准确率的训练策略。
  • 同时使用自动评估与人工评估,以验证所有指标维度下的性能表现。

实验结果

研究问题

  • RQ1当缺乏平行数据时,如何可靠地评估文本转换系统?
  • RQ2现有指标如后处理分类准确率在多大程度上能捕捉语义保真度与流畅度?
  • RQ3额外的损失函数能否在零样本文本转换中提升语义保留与流畅度?
  • RQ4所提出的指标与损失函数在自动评估与人工评估中相较于基线方法表现如何?

主要发现

  • 所提出的评估框架结合语义保留、流畅度与分类准确率,提供了比单一准确率更全面的评估。
  • 循环一致性损失与基于释义的损失的整合显著提升了语义内容保留。
  • 风格特定语言模型损失使生成的释义更加流畅。
  • 自动评估显示,与 Shen 等人(2017)的基线方法相比,性能有可测量的提升。
  • 人工评估确认,在所有三个指标维度上,生成的释义质量均更高。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。