[论文解读] MDD-Eval: Self-Training on Augmented Data for Multi-Domain Dialogue Evaluation
MDD-Eval 提出了一种自训练框架,利用人工标注数据训练教师评估器,随后使用伪标签化、增强后的多领域对话数据训练学生评估器,在六个基准测试中,与最先进指标相比,平均斯皮尔曼等级相关系数提升了7个百分点。
Chatbots are designed to carry out human-like conversations across different domains, such as general chit-chat, knowledge exchange, and persona-grounded conversations. To measure the quality of such conversational agents, a dialogue evaluator is expected to conduct assessment across domains as well. However, most of the state-of-the-art automatic dialogue evaluation metrics (ADMs) are not designed for multi-domain evaluation. We are motivated to design a general and robust framework, MDD-Eval, to address the problem. Specifically, we first train a teacher evaluator with human-annotated data to acquire a rating skill to tell good dialogue responses from bad ones in a particular domain and then, adopt a self-training strategy to train a new evaluator with teacher-annotated multi-domain data, that helps the new evaluator to generalize across multiple domains. MDD-Eval is extensively assessed on six dialogue evaluation benchmarks. Empirical results show that the MDD-Eval framework achieves a strong performance with an absolute improvement of 7% over the state-of-the-art ADMs in terms of mean Spearman correlation scores across all the evaluation benchmarks.
研究动机与目标
- 解决当前最先进自动对话评估指标(ADMs)在多样化对话领域中泛化能力不足的问题。
- 开发一种框架,仅基于有限的人工标注数据,同时学习响应质量评分能力和跨领域泛化能力。
- 通过结合人工标注数据与大规模、数据增强的合成数据,实现稳健的多领域评估。
- 发布一个大规模、多领域、机器标注的数据集(MDD-Data),以支持未来 ADM 的训练与研究。
提出的方法
- 在人工标注的对话数据上训练教师评估器,以学习领域特定的响应质量判别能力。
- 应用数据增强技术——随机话语选择、掩码填充和回译——生成合成的、多领域的对话数据。
- 使用教师模型为增强后的、未标注的多领域数据分配伪标签。
- 在伪标签化的多领域数据上微调学生评估器,以实现跨领域的评估能力泛化。
- 采用自训练范式,通过高置信度伪标签迭代提升学生模型的性能。
- 利用预训练语言模型作为教师和学生评估器的骨干网络,以确保强大的表征学习能力。
实验结果
研究问题
- RQ1如何使自动对话评估指标能够准确地对多样化对话领域中的响应质量进行评分?
- RQ2哪些技术能够使模型将评估能力泛化到其预训练领域之外?
- RQ3在数据增强的多领域数据上进行自训练,能否提升对话评估中的零样本和少样本泛化能力?
- RQ4当与数据增强结合时,教师-学生自训练框架在多领域评估中的有效性如何?
- RQ5高质量合成数据在提升 ADM 在多样化基准中鲁棒性方面发挥着怎样的作用?
主要发现
- 与最先进 ADM 相比,MDD-Eval 在六个对话评估基准上的平均斯皮尔曼等级相关系数提升了 7 个百分点。
- 尽管未在 Reddit 或 Twitter 数据上预训练,该框架在多个基准测试中(包括 Movie-Eval 和 Twitter-Eval)仍优于强基线模型 DEB 和 GRADE。
- 通过在 MDD-Data 上进行自监督训练的 MDD-S 模型,平均性能超过 DEB,表明自训练与数据增强流程的有效性。
- 案例研究显示,MDD-S 有时会为通用或语境无关的响应赋予高分,表明在特定性与长距离上下文建模方面仍有改进空间。
- 该模型在捕捉实体层面的转换和说话人依赖关系方面表现不佳,提示未来在结构化与依赖关系建模方面存在改进机会。
- MDD-Data 和 MDD-Eval 代码的发布,为多领域对话评估的可复现性与进一步研究提供了支持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。