Skip to main content
QUICK REVIEW

[论文解读] How To Evaluate Your Dialogue System: Probe Tasks as an Alternative for Token-level Evaluation Metrics

Prasanna Parthasarathi, Joëlle Pineau|arXiv (Cornell University)|Aug 24, 2020
Topic Modeling参考文献 66被引用 5
一句话总结

本文提出探针任务作为评估生成式对话系统的一种严格替代方案,以取代基于词元的度量方法。通过设计确定性、经人工标注的任务来测试超越表面生成的上下文理解能力,作者发现尽管变换器(Transformers)在BLEU分数上表现更优,但在理解任务中却逊于基于RNN的模型,揭示了当前度量方法未能捕捉到的模型理解能力的关键差距。

ABSTRACT

Though generative dialogue modeling is widely seen as a language modeling task, the task demands an agent to have a complex natural language understanding of its input text to carry a meaningful interaction with an user. The automatic metrics used evaluate the quality of the generated text as a proxy to the holistic interaction of the agent. Such metrics were earlier shown to not correlate with the human judgement. In this work, we observe that human evaluation of dialogue agents can be inconclusive due to the lack of sufficient information for appropriate evaluation. The automatic metrics are deterministic yet shallow and human evaluation can be relevant yet inconclusive. To bridge this gap in evaluation, we propose designing a set of probing tasks to evaluate dialogue models. The hand-crafted tasks are aimed at quantitatively evaluating a generative dialogue model's understanding beyond the token-level evaluation on the generated text. The probing tasks are deterministic like automatic metrics and requires human judgement in their designing; benefiting from the best of both worlds. With experiments on probe tasks we observe that, unlike RNN based architectures, transformer model may not be learning to comprehend the input text despite its generated text having higher overlap with the target text.

研究动机与目标

  • 解决自动度量(如BLEU、ROUGE)与人工判断之间相关性差的问题,以评估对话系统。
  • 克服人工评估的局限性,其主观性强、耗时长,且常因信息不足而无法得出明确结论。
  • 开发一种确定性、可解释的评估框架,以隔离并衡量模型的语言理解能力。
  • 识别生成式对话模型架构中的弱点,特别是强生成能力与弱理解能力之间的差异。
  • 提供一个基准,用于根据模型在对话上下文推理能力方面的表现进行比较,而无需依赖表面流畅性。

提出的方法

  • 设计一组手工构建的探针任务,以测试对话理解的特定方面,如实体追踪、指代消解和意图推断。
  • 将探针任务划分为三个难度等级:简单(基线F1高)、中等(基线适中)和困难(基线F1低),以实现系统性比较。
  • 在MultiWOZ数据集上,使用这些探针任务对多种对话架构(包括LSTM、HRED、BiLSTM和Transformer)进行训练与评估。
  • 将探针任务的F1分数汇总作为整体评估指标,分数越高表示上下文理解能力越强。
  • 比较模型在不同探针任务中的表现,以评估其泛化能力与归纳偏置,尤其关注其在应对未见对话推理挑战时的表现。
  • 将未训练模型在探针任务上的表现作为其内在表征能力的代理,识别出即使基线模型也难以应对的任务。

实验结果

研究问题

  • RQ1探针任务能否作为评估对话模型的可靠、确定性替代方案,以替代自动度量?
  • RQ2尽管生成质量表面良好,强生成模型(如Transformer)在多大程度上仍无法理解对话上下文?
  • RQ3不同神经架构(如RNN与Transformer)在解决结构化理解任务方面的能力如何比较?
  • RQ4是否存在特定探针任务,能暴露当前对话模型架构的根本性局限?
  • RQ5探针任务能否用于根据其挑战模型理解能力的程度,对对话数据集进行排序?

主要发现

  • 与LSTM模型相比,Transformer在中等和困难探针任务上的表现显著更低(分别为43.3%和24.4%的F1),而LSTM模型在相同任务上的得分分别为65.7%和44.4%。
  • 尽管BLEU分数更高,Transformer在上下文理解方面仍弱于基于RNN的模型,表明生成质量与理解能力之间存在脱节。
  • 所有模型在困难探针任务上均表现不佳,表明当前架构在深层对话理解方面缺乏足够的归纳偏置。
  • 探针任务揭示,即使生成了流畅响应,模型在实体追踪和指代消解方面也经常出错。
  • 结果表明,BLEU等词元级度量在对话系统中作为真实语言理解的代理指标效果极差。
  • 本研究证明,探针任务能有效识别架构缺陷,并指导开发具备更好归纳偏置的对话理解模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。