Skip to main content
QUICK REVIEW

[论文解读] Learning to Compare for Better Training and Evaluation of Open Domain Natural Language Generation Models

Wangchunshu Zhou, Ke Xu|arXiv (Cornell University)|Feb 12, 2020
Topic Modeling参考文献 28被引用 4
一句话总结

本文提出了一种自监督的'对比学习'框架,通过成对比较生成的响应,微调 BERT 以评估自然语言生成(NLG)模型,从而提高与人类偏好的相关性。该方法采用技能评分系统进行模型级评估,并在训练和评估中均优于 BLEU 和困惑度,尤其在使用极少的人类偏好数据进行微调时表现更优。

ABSTRACT

Automated evaluation of open domain natural language generation (NLG) models remains a challenge and widely used metrics such as BLEU and Perplexity can be misleading in some cases. In our paper, we propose to evaluate natural language generation models by learning to compare a pair of generated sentences by fine-tuning BERT, which has been shown to have good natural language understanding ability. We also propose to evaluate the model-level quality of NLG models with sample-level comparison results with skill rating system. While able to be trained in a fully self-supervised fashion, our model can be further fine-tuned with a little amount of human preference annotation to better imitate human judgment. In addition to evaluating trained models, we propose to apply our model as a performance indicator during training for better hyperparameter tuning and early-stopping. We evaluate our approach on both story generation and chit-chat dialogue response generation. Experimental results show that our model correlates better with human preference compared with previous automated evaluation approaches. Training with the proposed metric yields better performance in human evaluation, which further demonstrates the effectiveness of the proposed model.

研究动机与目标

  • 解决 BLEU 和困惑度等标准指标在开放域 NLG 任务中与人类判断相关性差的问题。
  • 开发一种基于自监督和迁移学习的自动化评估方法,更好地反映人类偏好。
  • 通过基于样本级成对比较的技能评分系统,实现在模型层面的有效评估。
  • 通过用所提出的对比评估器替代 BLEU 等次优指标,改进训练过程中的超参数调优和早停策略。
  • 通过弱监督和有限的人类偏好数据实现有效预训练,减少对昂贵人工标注的依赖。

提出的方法

  • 微调 BERT 以分类两个生成的 NLG 输出中哪一个更优,使用成对分类头。
  • 使用强监督(将黄金参考文本视为优于生成输出)和弱监督(随着训练步骤推进,模型质量逐步提升)以自监督方式训练模型。
  • 引入“平局”选项,使模型能够在两个输出评分相近时表达不确定性。
  • 采用类似 ELO/Trueskill 的技能评分系统,基于成对比较结果对 NLG 模型进行排名,实现高效的模型级评估。
  • 使用极少的人类偏好标注对模型进行微调,以更好地与人类判断对齐。
  • 在训练过程中将训练好的对比评估器用作损失函数或评估指标,以指导超参数调优和早停。

实验结果

研究问题

  • RQ1基于 BERT 的自监督成对比较模型是否能实现比 BLEU 和困惑度等传统指标更高的与人类偏好的相关性?
  • RQ2当用作训练目标或早停标准时,该方法在提升模型训练效果方面有多有效?
  • RQ3强监督、弱监督、人类偏好数据和平局选项各成分对最终性能的贡献如何?
  • RQ4在无须人类偏好标注的情况下,该模型是否具备良好的泛化能力?其在该设置下与基线方法相比表现如何?
  • RQ5该技能评分系统是否提供了比直接平均比较结果更准确、更高效的模型级评估方法?

主要发现

  • 所提出的模型在 Dailydialog 数据集上与人类偏好的斯皮尔曼相关系数达到 0.764,皮尔逊相关系数达到 0.783,显著优于 BLEU 和其他基线模型。
  • 若移除成对比较机制(w/o comparison),相关系数降至 0.491(斯皮尔曼),表明比较机制对性能至关重要。
  • 引入平局选项可提升性能,若不包含该选项,相关系数下降至 0.557,表明其有助于模型表达不确定性并提升泛化能力。
  • 使用人类偏好标注进行微调可获得最高相关系数,但即使不使用,模型仍表现良好(斯皮尔曼相关系数 0.602),证明其在低资源场景下的实用性。
  • 使用 BERT 作为基础模型至关重要——从头训练仅获得 0.644 的斯皮尔曼相关系数,表明预训练语言理解能力的重要性。
  • 在训练过程中使用该指标可提升人类评估下的模型性能,证明其在指导超参数调优和早停方面的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。