[论文解读] Domain-Independent turn-level Dialogue Quality Evaluation via User Satisfaction Estimation
该论文提出了一种领域无关的、基于用户满意度的对话质量评估框架,采用新颖的响应质量(RQ)标注方案及五种新的领域无关特征。通过梯度提升回归模型,预测值与标注的用户满意度之间达到较高的相关性(r ≈ 0.79),消融实验显示显著改进,且在未见领域上具有良好泛化能力(r ≈ 0.67)。
An automated metric to evaluate dialogue quality is vital for optimizing data driven dialogue management. The common approach of relying on explicit user feedback during a conversation is intrusive and sparse. Current models to estimate user satisfaction use limited feature sets and rely on annotation schemes with low inter-rater reliability, limiting generalizability to conversations spanning multiple domains. To address these gaps, we created a new Response Quality annotation scheme, based on which we developed turn-level User Satisfaction metric. We introduced five new domain-independent feature sets and experimented with six machine learning models to estimate the new satisfaction metric. Using Response Quality annotation scheme, across randomly sampled single and multi-turn conversations from 26 domains, we achieved high inter-annotator agreement (Spearman's rho 0.94). The Response Quality labels were highly correlated (0.76) with explicit turn-level user ratings. Gradient boosting regression achieved best correlation of ~0.79 between predicted and annotated user satisfaction labels. Multi Layer Perceptron and Gradient Boosting regression models generalized to an unseen domain better (linear correlation 0.67) than other models. Finally, our ablation study verified that our novel features significantly improved model performance.
研究动机与目标
- 开发一种可扩展的、领域无关的对话轮次级质量评估方法,避免使用侵入式用户反馈。
- 解决现有交互质量(IQ)标注方案的局限性,其存在较低的评分者间一致性以及跨领域泛化能力差的问题。
- 设计一种新的响应质量(RQ)标注方案,与显式用户满意度评分高度相关,并支持多领域评估。
- 设计五种新的领域无关特征,分别捕捉用户重述、响应连贯性、话题多样性、不可操作请求以及话题流行度。
- 训练并评估机器学习模型,以高精度预测连续的用户满意度评分,并具备对未见领域的良好泛化能力。
提出的方法
- 引入一种新的响应质量(RQ)标注方案,三位标注员根据目标达成情况在1–5分制上对每个对话轮次进行评分,取平均值作为连续目标变量。
- 设计五套新颖的特征集:用户重述检测、系统响应连贯性、对话中的话题多样性、不可操作的用户请求,以及基于使用统计数据的总体话题流行度。
- 在标注数据上训练六种机器学习模型——LASSO、决策树、随机森林、梯度提升、多层感知机(MLP)和支持向量回归(SVR),以预测连续的用户满意度得分。
- 采用皮尔逊相关系数(r)和不满意度轮次的F-score作为评估指标,并通过消融实验评估特征重要性及其影响。
- 采用模型可解释性技术对特征进行重要性排序,并验证其对性能的贡献。
- 预留一个未见过的多轮次Alexa技能用于零样本泛化评估,以测试模型在跨领域场景下的鲁棒性。
实验结果
研究问题
- RQ1能否基于一种与显式用户满意度评分高度相关的新型标注方案,构建一个领域无关的对话质量评估框架?
- RQ2与传统特征相比,所提出的五种新领域无关特征在用户满意度估计模型性能方面有何提升?
- RQ3在轮次级用户满意度预测中,哪些机器学习模型在未见领域上泛化能力最佳?
- RQ4这些新特征在未见领域上的零样本设置中,对模型性能的增强程度如何?
- RQ5所提出的用户满意度估计(USE)度量能否作为强化学习驱动对话策略优化中奖励建模的可行替代方案?
主要发现
- RQ标注方案实现了高评分者间一致性,斯皮尔曼等级相关系数为0.94,表明其具有强可靠性。
- RQ评分与显式轮次级用户满意度评分之间具有高度相关性(r = 0.76),验证了其作为代理指标的有效性。
- 在已见领域上,梯度提升回归模型表现最佳,预测值与标注满意度得分之间的相关系数为r ≈ 0.79。
- 在未见的多轮次技能上,梯度提升与MLP模型的相关系数均达到r ≈ 0.67,优于其他模型,展现出强大的泛化能力。
- 消融实验表明,'总体话题流行度'特征在单轮领域中使相关性提升约7%,而'不可操作请求'特征在未见技能上带来了约35%的相对性能提升。
- 五种新特征集在梯度提升模型中位列前10大重要特征,证实其对预测性能有显著贡献。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。