[论文解读] Multi-domain Conversation Quality Evaluation via User Satisfaction Estimation
本文提出了一种适用于多领域对话人工智能的领域无关用户满意度估计(USE)框架,引入了一种新的响应质量(RQ)标注方案以及五种新颖的特征集,以在回合和对话两个层面预测用户满意度。采用梯度提升回归模型,在已见领域上与人工标注评分的线性相关系数达到0.79,在新的多轮对话领域上达到0.67,且在二元满意度分类准确率上实现了16%的相对提升,方法中引入了回合级预测结果。
An automated metric to evaluate dialogue quality is vital for optimizing data driven dialogue management. The common approach of relying on explicit user feedback during a conversation is intrusive and sparse. Current models to estimate user satisfaction use limited feature sets and employ annotation schemes with limited generalizability to conversations spanning multiple domains. To address these gaps, we created a new Response Quality annotation scheme, introduced five new domain-independent feature sets and experimented with six machine learning models to estimate User Satisfaction at both turn and dialogue level. Response Quality ratings achieved significantly high correlation (0.76) with explicit turn-level user ratings. Using the new feature sets we introduced, Gradient Boosting Regression model achieved best (rating [1-5]) prediction performance on 26 seen (linear correlation ~0.79) and one new multi-turn domain (linear correlation 0.67). We observed a 16% relative improvement (68% -> 79%) in binary ("satisfactory/dissatisfactory") class prediction accuracy of a domain-independent dialogue-level satisfaction estimation model after including predicted turn-level satisfaction ratings as features.
研究动机与目标
- 开发一种可扩展的、领域无关的指标,用于评估多领域对话中的对话质量。
- 解决现有方法依赖侵入式反馈、稀疏标注或领域特定特征的局限性。
- 通过引入可跨领域泛化的、上下文丰富的新型特征集,提升对话质量估计性能。
- 通过将预测的回合级满意度作为特征引入,提升对话级满意度预测性能。
- 通过提供可靠、自动化的用户满意度信号,实现基于数据的对话策略优化。
提出的方法
- 提出了一种新的响应质量(RQ)标注方案,对每个对话回合的用户满意度进行1–5分的连续评分,与显式用户评分的相关系数达到0.76,表现出高度一致性。
- 设计了五种新的领域无关特征集:请求重述指示符、响应连贯性、话题多样性、不可操作请求检测以及综合领域流行度。
- 在标注数据上训练了六种机器学习模型,包括梯度提升回归、多层感知机(MLP)和套索回归(Lasso),以预测回合级用户满意度。
- 使用梯度提升模型估计回合级满意度,并将平均预测评分作为特征引入对话级模型,以提升泛化能力。
- 应用特征重要性分析以解释模型预测结果,并验证新特征的相关性。
- 在26个已见领域和一个未见的多轮对话领域上进行基准测试,评估回归与二元分类指标。
实验结果
研究问题
- RQ1连续的、回合级的用户满意度估计模型是否能在多样化的多领域对话交互中实现泛化?
- RQ2新颖的、领域无关的特征在多大程度上提升了对话质量估计模型的性能?
- RQ3将预测的回合级满意度引入模型,能在多大程度上提升对话级满意度预测的准确率?
- RQ4所提出的响应质量(RQ)标注方案是否与显式用户反馈具有强相关性?
- RQ5不同机器学习模型在新、未见的多轮对话领域上的泛化能力如何?
主要发现
- 响应质量(RQ)标注方案与显式回合级用户评分的线性相关系数达到0.76,证明其具有高度的有效性与可靠性。
- 梯度提升回归模型表现最佳,在26个已见领域上,预测RQ评分与标注RQ评分之间的线性相关系数达到0.79。
- 在新的多轮对话领域上,模型仍保持0.67的相关系数,表明其对未见应用场景具有稳健的泛化能力。
- 在对话级模型中引入平均预测回合级满意度作为特征后,二元满意度分类准确率提升了16%(从68%提升至79%)。
- 梯度提升模型在14个对话领域上的真实对话级评分预测相关系数达到0.60,显著优于基线模型。
- 特征重要性分析确认,平均预测回合级满意度是影响最大的特征,其次为平均ASR得分和领域流行度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。