Skip to main content
QUICK REVIEW

[论文解读] PONE: A Novel Automatic Evaluation Metric for Open-Domain Generative Dialogue Systems

Tian Lan, Xian-Ling Mao|arXiv (Cornell University)|Apr 6, 2020
Topic Modeling参考文献 28被引用 16
一句话总结

该论文提出PONE,一种新颖的基于学习的开放域生成对话系统自动评估指标,通过使用数据增强的正样本和加权负样本采样策略,提升了与人类判断的相关性。PONE在与SOTA方法(如BERT-RUBER)相比,平均相关性提升13.18%,在流畅性、连贯性和参与度方面均展现出更优的人类评估对齐能力。

ABSTRACT

Open-domain generative dialogue systems have attracted considerable attention over the past few years. Currently, how to automatically evaluate them, is still a big challenge problem. As far as we know, there are three kinds of automatic methods to evaluate the open-domain generative dialogue systems: (1) Word-overlap-based metrics; (2) Embedding-based metrics; (3) Learning-based metrics. Due to the lack of systematic comparison, it is not clear which kind of metrics are more effective. In this paper, we will first measure systematically all kinds of automatic evaluation metrics over the same experimental setting to check which kind is best. Through extensive experiments, the learning-based metrics are demonstrated that they are the most effective evaluation metrics for open-domain generative dialogue systems. Moreover, we observe that nearly all learning-based metrics depend on the negative sampling mechanism, which obtains an extremely imbalanced and low-quality dataset to train a score model. In order to address this issue, we propose a novel and feasible learning-based metric that can significantly improve the correlation with human judgments by using augmented POsitive samples and valuable NEgative samples, called PONE. Extensive experiments demonstrate that our proposed evaluation method significantly outperforms the state-of-the-art learning-based evaluation methods, with an average correlation improvement of 13.18%. In addition, we have publicly released the codes of our proposed method and state-of-the-art baselines.

研究动机与目标

  • 系统比较词重叠型、嵌入型和基于学习的评估指标在开放域对话系统评估中的有效性。
  • 识别现有基于学习的评估指标的局限性,特别是其对不平衡且低质量负样本的依赖。
  • 提出一种新的基于学习的评估指标PONE,通过提升数据质量和决策边界学习来增强模型性能。
  • 在多个基准上验证所提方法,并证明其在性能上优于SOTA基线方法。

提出的方法

  • PONE采用数据增强技术——特别是EDA和基于Seq2Seq的方法——生成高质量正样本,缓解类别不平衡问题。
  • 引入一种加权负样本采样器,优先选择信息量丰富、难以区分的负样本,而非随机采样,以改善决策边界学习。
  • 应用一种新颖的迭代标签过滤算法,以减少增强正样本中的噪声,提升训练数据质量。
  • 通过结合增强正样本和有策略选择的负样本训练得分模型,超参数经调优以实现最佳性能。
  • 框架集成基于温度的采样策略,并控制生成正样本的数量(k),以平衡多样性与质量。
  • 采用迭代优化过程,减轻增强数据中的噪声,提升模型泛化能力。

实验结果

研究问题

  • RQ1在开放域对话系统中,词重叠型、嵌入型或基于学习的自动评估指标中,哪一类与人类判断的相关性最高?
  • RQ2训练数据质量,特别是负样本的质量与平衡性,如何影响基于学习的评估指标的性能?
  • RQ3对正样本进行数据增强和智能负样本采样,能否改善对话评估中得分模型的决策边界?
  • RQ4PONE在与人类判断的相关性方面,相较于现有SOTA基于学习的指标(如BERT-RUBER和BERTScore)的优越程度如何?
  • RQ5PONE的各个组件——正样本生成器、加权负样本采样器和标签过滤器——在性能提升中各自及协同发挥的作用如何?

主要发现

  • PONE在多个数据集和评估维度上,相较于SOTA指标BERT-RUBER,实现了13.18%的平均相关性提升。
  • 系统性比较表明,基于学习的指标在与人类判断对齐方面显著优于词重叠型和嵌入型指标。
  • 使用基于Seq2Seq的数据增强方法生成正样本,性能优于EDA,表明更高品质的生成样本可带来更优的指标学习效果。
  • 加权负样本采样策略显著提升性能,通过选择更具信息量的负样本,降低低质量样本的影响。
  • 标签过滤算法有效减少了增强正样本中的噪声,从而在各类设置中均实现一致的性能提升。
  • PONE的性能非常接近平均人类判断水平,尤其在单轮对话设置中表现突出,表明其具备极强的人类对齐能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。