Skip to main content
QUICK REVIEW

[论文解读] Beyond User Self-Reported Likert Scale Ratings: A Comparison Model for Automatic Dialog Evaluation

Weixin Liang, James Zou|arXiv (Cornell University)|May 21, 2020
Topic Modeling参考文献 60被引用 7
一句话总结

本文提出 CMADE,一种三阶段去噪流水线,通过将嘈杂的自报李克特量表评分转化为可靠的基于比较的判断,提升了自动对话评估性能。利用自监督表示学习、基于 KNN 的标签平滑以及数据 Shapley 进行样本剪枝,CMADE 在专家标注的对话对上实现了 89.2% 的准确率和 0.787 的 Kappa 值,显著优于基线模型。

ABSTRACT

Open Domain dialog system evaluation is one of the most important challenges in dialog research. Existing automatic evaluation metrics, such as BLEU are mostly reference-based. They calculate the difference between the generated response and a limited number of available references. Likert-score based self-reported user rating is widely adopted by social conversational systems, such as Amazon Alexa Prize chatbots. However, self-reported user rating suffers from bias and variance among different users. To alleviate this problem, we formulate dialog evaluation as a comparison task. We also propose an automatic evaluation model CMADE (Comparison Model for Automatic Dialog Evaluation) that automatically cleans self-reported user ratings as it trains on them. Specifically, we first use a self-supervised method to learn better dialog feature representation, and then use KNN and Shapley to remove confusing samples. Our experiments show that CMADE achieves 89.2% accuracy in the dialog comparison task.

研究动机与目标

  • 为解决真实对话系统(如 Amazon Alexa)中自报李克特量表评分存在的高偏差和高方差问题。
  • 通过将嘈杂的用户评分转化为可靠的基于比较的判断,提升自动对话评估性能。
  • 开发一种去噪流水线,以增强模型的泛化能力并使其与专家判断对齐。
  • 证明基于比较的评估框架可优于基于参考的指标和原始用户评分。

提出的方法

  • 首先,应用自监督学习,利用预训练的 BERT 基础编码器学习鲁棒的对话表示。
  • 其次,在学习到的特征空间上应用基于 KNN 的标签平滑,以减少自报评分中的噪声。
  • 第三,使用数据 Shapley 识别并移除对模型性能贡献较低的训练样本。
  • 在清洗后的数据集上微调模型,以提升泛化能力并避免对噪声标签的过拟合。
  • 使用去噪后的数据训练成对比较模型,以预测两个对话回复中哪一个更优。
  • 使用从预训练权重初始化的 BERT 基础对话编码器,以确保强大的初始特征表示。

实验结果

研究问题

  • RQ1基于比较的自动评估模型是否能在开放域对话系统中优于基于参考的指标(如 BLEU)?
  • RQ2如何有效对嘈杂的自报李克特量表评分进行去噪,以提升模型性能?
  • RQ3渐进式的三阶段去噪流水线(从自监督表示学习开始,以数据 Shapley 结束)是否能提升模型的准确率和鲁棒性?
  • RQ4数据 Shapley 在多大程度上能帮助识别并移除对话评估中的噪声训练样本?

主要发现

  • CMADE 在专家标注的对话对测试集上实现了 89.2% 的准确率和 0.787 的 Kappa 值,表现出与人类判断的高度一致性。
  • 三阶段流水线显著优于所有基线模型,包括未进行去噪的模型以及采用随机样本移除的模型。
  • 阶段 1(自监督表示学习)至关重要:即使使用 BERT 初始化,跳过该阶段也会导致后续阶段性能下降。
  • 在阶段 3 中,结合前期阶段的数据 Shapley 去噪效果最佳,准确率提升达 0.837 至 0.892。
  • 移除低 Shapley 值样本可提升 KNN 回归器性能,而随机移除则导致性能下降,验证了基于 Shapley 的剪枝方法的有效性。
  • 将开发集直接加入训练数据的效果不如使用其进行数据 Shapley 去噪,表现为 BERT-Pairwise+Dev 的准确率为 0.749,而 CMADE 达到 0.892。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。