Skip to main content
QUICK REVIEW

[论文解读] How to Evaluate the Next System: Automatic Dialogue Evaluation from the Perspective of Continual Learning

Li Lü, Zhongheng He|arXiv (Cornell University)|Dec 10, 2019
Topic Modeling参考文献 21被引用 5
一句话总结

本文提出一种持续学习方法,通过微调预训练的神经评估器,使其在不遗忘先前知识的前提下适应新的对话系统,从而提升自动对话评估的效果。通过应用弹性权重巩固(EWC)和变分持续学习(VCL),该方法在性能上可与完整微调相媲美,同时显著减少标注需求,并消除维护多个评估器的需要,从而实现可扩展、低成本且保护隐私的长期评估。

ABSTRACT

Automatic dialogue evaluation plays a crucial role in open-domain dialogue research. Previous works train neural networks with limited annotation for conducting automatic dialogue evaluation, which would naturally affect the evaluation fairness as dialogue systems close to the scope of training corpus would have more preference than the other ones. In this paper, we study alleviating this problem from the perspective of continual learning: given an existing neural dialogue evaluator and the next system to be evaluated, we fine-tune the learned neural evaluator by selectively forgetting/updating its parameters, to jointly fit dialogue systems have been and will be evaluated. Our motivation is to seek for a lifelong and low-cost automatic evaluation for dialogue systems, rather than to reconstruct the evaluator over and over again. Experimental results show that our continual evaluator achieves comparable performance with reconstructing new evaluators, while requires significantly lower resources.

研究动机与目标

  • 解决静态神经对话评估器在评估未涵盖范围的对话系统时泛化能力差的问题。
  • 降低为每个新对话系统从零开始重新训练评估器所带来的资源成本和维护负担。
  • 通过允许单一评估器适应新系统并保留对先前系统的知识,实现终身评估。
  • 通过最小化对训练分布内系统的偏差,提升评估的公平性。
  • 探究持续学习是否能在减少标注数据的前提下,实现与完整微调相当的性能。

提出的方法

  • 使用持续学习技术微调现有的神经对话评估器(ADEM),使其在不遗忘先前知识的前提下适应新对话系统。
  • 应用弹性权重巩固(EWC)技术,选择性地保留先前对话系统的重要参数,同时更新其他参数以适应新系统。
  • 采用变分持续学习(VCL)方法,对模型权重维持贝叶斯后验分布,通过新数据逐步更新知识。
  • 维护一个统一的评估器,联合拟合所有先前和新评估的对话系统,避免从零开始重新训练。
  • 按序列对评估器进行增量训练,使用人类标注的评分作为每个新系统监督信号。
  • 通过评估可塑性(对新系统的适应能力)和稳定性(与先前预测的一致性)来衡量持续学习的性能。

实验结果

研究问题

  • RQ1持续学习能否使神经对话评估器的泛化能力超越其原始训练分布?
  • RQ2与完整微调相比,持续微调在评估准确性和资源效率方面表现如何?
  • RQ3持续学习在适应新对话系统的同时,能在多大程度上保留对过去对话系统的知识?
  • RQ4持续学习是否能减少评估新对话系统所需的标注成本?
  • RQ5基于持续学习的评估器能否在不发生灾难性遗忘的情况下,保持在多样化对话系统上的稳定性能?

主要发现

  • 基于持续学习的评估器(EWC与VCL)在评估下一个对话系统时,性能可与完整微调相媲美,其在人类-系统数据集上的斯皮尔曼等级相关系数达到0.78,接近完整重建方法实现的0.80。
  • 基于EWC的评估保持了高稳定性,对先前评估系统的准确率仅下降0.055,同时可塑性依然较强。
  • 基于VCL的评估在人类-系统数据集上的可塑性略低(0.190),相较于EWC(0.245),表明EWC在稳定性和可塑性之间具有更好的平衡。
  • 随着训练规模减小,持续学习方法(EWC与VCL)的可塑性受的影响较小,而微调方法的可塑性在人类-系统数据集上从0.345急剧下降至0.190。
  • 持续学习方法显著减少了标注需求,避免了维护多个评估器或大规模标注集的需要,从而实现可扩展且保护隐私的评估。
  • 该方法通过仅选择性地更新非关键参数,成功缓解了稳定-可塑性困境,有效保留了先前对话系统的知识。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。