Skip to main content
QUICK REVIEW

[论文解读] Evaluating Style Transfer for Text

Remi Mir, Bjarke Felbo|arXiv (Cornell University)|Apr 4, 2019
Topic Modeling参考文献 24被引用 6
一句话总结

本文提出了一种基于人工与自动指标的标准化文本风格迁移评估框架,用于衡量风格迁移强度、内容保留度和自然度。该框架引入了方向校正的地球移动距离(direction-corrected Earth Mover’s Distance)、风格掩码的词移动距离(style-masked Word Mover’s Distance)以及对抗性分类方法,其与人类判断的相关性优于以往方法,并揭示了不同模型之间的关键权衡关系。

ABSTRACT

Research in the area of style transfer for text is currently bottlenecked by a lack of standard evaluation practices. This paper aims to alleviate this issue by experimentally identifying best practices with a Yelp sentiment dataset. We specify three aspects of interest (style transfer intensity, content preservation, and naturalness) and show how to obtain more reliable measures of them from human evaluation than in previous work. We propose a set of metrics for automated evaluation and demonstrate that they are more strongly correlated and in agreement with human judgment: direction-corrected Earth Mover's Distance, Word Mover's Distance on style-masked texts, and adversarial classification for the respective aspects. We also show that the three examined models exhibit tradeoffs between aspects of interest, demonstrating the importance of evaluating style transfer models at specific points of their tradeoff plots. We release software with our evaluation metrics to facilitate research.

研究动机与目标

  • 解决文本风格迁移研究中缺乏标准化评估实践的问题。
  • 识别更可靠的风格迁移强度、内容保留度和自然度的人工评估方法。
  • 开发与人类判断高度相关的自动化指标。
  • 展示不同风格迁移模型在各项评估指标之间的权衡关系。
  • 发布开源软件以实现所提出的评估指标。

提出的方法

  • 使用Yelp情感数据集评估三种风格迁移模型:CAAE、ARAE和DAR。
  • 引入一种保守的风格词典,用于识别并掩码风格词,从而减少评估中内容词的干扰。
  • 采用输入与输出文本的相对自然度评分方法,以提高评分者间的一致性。
  • 提出方向校正的地球移动距离(EMD),通过引入方向性惩罚来测量风格迁移强度。
  • 在风格掩码文本上应用词移动距离,以评估内容保留度,避免BLEU在单参考设置下的局限性。
  • 使用对抗性分类器实现自然度的自动化评估,其结果与人类相对评分高度一致。

实验结果

研究问题

  • RQ1如何使风格迁移的人工评估在不同研究中更加可靠和一致?
  • RQ2哪些自动化指标与人类判断的相关性最佳,适用于风格迁移评估?
  • RQ3不同风格迁移模型在风格迁移强度、内容保留度和自然度之间存在多大程度的权衡?
  • RQ4自动化指标在多大程度上可以替代或补充成本高昂的人工评估?
  • RQ5评估指标在不同风格迁移模型及超参数设置下的表现如何?

主要发现

  • 方向校正的地球移动距离在衡量风格迁移强度方面,与人类判断的相关性优于以往基于分类器的方法。
  • 在风格掩码文本上应用词移动距离,在内容保留度测量方面优于BLEU,因其支持单参考设置且具备语义敏感性。
  • 用于自然度评估的对抗性分类器与人类相对评分结果高度一致,验证了其在自动化评估中的有效性。
  • 所评估的三种模型(CAAE、ARAE、DAR)在三项评估指标间表现出显著的权衡关系,凸显了多维度评估的必要性。
  • 模型性能随超参数设置而变化,权衡图中的交点表明在特定配置下,不同模型的性能相当。
  • 所提出的评估框架,包括风格词典和相对评分机制,提升了评分者间的一致性,并降低了人工评估中的噪声。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。