Skip to main content
QUICK REVIEW

[论文解读] Designing Precise and Robust Dialogue Response Evaluators

Tianyu Zhao, Divesh Lala|arXiv (Cornell University)|Apr 10, 2020
Topic Modeling参考文献 20被引用 5
一句话总结

本文提出了一种基于RoBERTa的无参考、半监督对话回复评估器,以提升精确度和鲁棒性。通过结合无参考评分、在有限人工标注数据上的半监督微调,以及强大的预训练表示,该模型在人类判断上的皮尔逊相关系数 >0.6,斯皮尔曼相关系数 >0.66,优于先前方法在跨领域和低资源设置下的表现。

ABSTRACT

Automatic dialogue response evaluator has been proposed as an alternative to automated metrics and human evaluation. However, existing automatic evaluators achieve only moderate correlation with human judgement and they are not robust. In this work, we propose to build a reference-free evaluator and exploit the power of semi-supervised training and pretrained (masked) language models. Experimental results demonstrate that the proposed evaluator achieves a strong correlation (> 0.6) with human judgement and generalizes robustly to diverse responses and corpora. We open-source the code and data in https://github.com/ZHAOTING/dialog-processing.

研究动机与目标

  • 解决现有自动对话回复评估器相关性有限且鲁棒性差的问题。
  • 通过消除对参考回复的依赖,提升评估精确度,从而避免因参考依赖导致的分数偏差低和泛化能力差的问题。
  • 通过在有限人工标注数据上进行半监督训练,并结合强大的预训练语言模型,提升评估器的鲁棒性。
  • 实现在低资源和跨领域设置下的有效评估。
  • 开发一种能良好泛化到多样化、未见回复和语料库的评估器。

提出的方法

  • 提出一种无参考评估器,以消除参考依赖度量带来的偏差和低偏差问题。
  • 通过在少量人工标注的回复质量分数上微调预训练的RoBERTa模型,实现半监督训练。
  • 采用类似于下一句预测(NSP)的对比学习目标,在大规模对话数据上预训练模型。
  • 将RoBERTa的上下文表示与全连接网络结合,以预测回复质量分数。
  • 在预训练过程中应用边缘排序损失,以区分真实回复与负样本。
  • 以多轮对话上下文和回复对作为输入,预测单一质量分数。

实验结果

研究问题

  • RQ1无参考回复评估器是否能比参考依赖的基线方法获得与人类判断更高的相关性?
  • RQ2在有限人工标注数据上进行的半监督微调是否能提升评估器的性能和鲁棒性?
  • RQ3基于RoBERTa的模型是否能有效泛化到未见领域和低资源设置?
  • RQ4所提出的评估器对对抗性或分布外的回复有多鲁棒?
  • RQ5当测试数据中移除真实回复时,评估器是否仍能保持性能?

主要发现

  • 基于RoBERTa的评估器与人类判断的皮尔逊相关系数为0.64,斯皮尔曼相关系数为0.66,显著优于ADEM(0.34,0.36)和RUBER(0.37,0.31)。
  • 在无真实回复的测试中,评估器仍保持高相关性(皮尔逊相关系数0.62,斯皮尔曼相关系数0.64),证明其对参考移除具有鲁棒性。
  • 当在DailyDialog上训练并在PersonaChat上测试时,模型在PersonaChat语料上实现了0.69的皮尔逊相关系数和0.69的斯皮尔曼相关系数,表明其泛化能力良好。
  • 当在PersonaChat上训练并在DailyDialog上测试时,性能下降,表明迁移学习中存在领域敏感性。
  • 仅使用100个标注样本,模型即可达到接近最优的性能,显示出强大的低资源学习能力。
  • 评估器与相关性标注的相关系数为0.68(皮尔逊)和0.67(斯皮尔曼),但与语法正确性标注的相关系数仅为0.09和0.15,表明其更擅长捕捉语境适宜性而非语法正确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。