Skip to main content
QUICK REVIEW

[论文解读] Towards a Better Metric for Evaluating Question Generation Systems

Preksha Nema, Mitesh M. Khapra|arXiv (Cornell University)|Aug 30, 2018
Topic Modeling参考文献 31被引用 6
一句话总结

本文提出一种改进的度量方法 Q-BLEU,通过整合可回答性(即关注 Wh-词、实体和关系等关键问题成分)与 n-gram 相似性,提升了自动问题生成(AQG)系统的评估效果。该方法利用人类判断进行调优的可学习权重,与标准度量方法(如 BLEU、METEOR 和 NIST)相比,与人类评估的相关性显著提高。

ABSTRACT

There has always been criticism for using $n$-gram based similarity metrics, such as BLEU, NIST, etc, for evaluating the performance of NLG systems. However, these metrics continue to remain popular and are recently being used for evaluating the performance of systems which automatically generate questions from documents, knowledge graphs, images, etc. Given the rising interest in such automatic question generation (AQG) systems, it is important to objectively examine whether these metrics are suitable for this task. In particular, it is important to verify whether such metrics used for evaluating AQG systems focus on answerability of the generated question by preferring questions which contain all relevant information such as question type (Wh-types), entities, relations, etc. In this work, we show that current automatic evaluation metrics based on $n$-gram similarity do not always correlate well with human judgments about answerability of a question. To alleviate this problem and as a first step towards better evaluation metrics for AQG, we introduce a scoring function to capture answerability and show that when this scoring function is integrated with existing metrics, they correlate significantly better with human judgments. The scripts and data developed as a part of this work are made publicly available at https://github.com/PrekshaNema25/Answerability-Metric

研究动机与目标

  • 批判性评估现有基于 n-gram 的度量方法(如 BLEU、METEOR、NIST)在评估自动问题生成(AQG)系统时的适用性。
  • 探究当前度量方法是否充分反映了生成问题的可回答性——即问题是否包含足够的信息以使其可被回答。
  • 开发一种改进的度量方法,将可回答性作为可学习组件整合,以提高与人类判断的一致性。
  • 通过内在相关性分析和外部评估(基于下游 QA 模型性能)验证所提度量方法的有效性。
  • 发布人工标注的数据和代码,以支持 AQG 评估的可复现性及进一步研究。

提出的方法

  • 通过在 SQuAD、WikiMovies 和 VQA 数据集的参考问题中引入系统性噪声(如移除 Wh-词、停用词、命名实体),收集人类对问题可回答性的判断。
  • 定义一种 Q-度量方法,将 n-gram 相似性(如 BLEU)与基于关键问题成分(如 Wh-词、实体和关系)存在性的可学习可回答性得分相结合。
  • 使用人工标注的可回答性得分作为标签,训练逻辑回归模型以学习不同问题成分的权重。
  • 将学习到的可回答性组件整合到标准度量中,形成 Q-BLEU,该度量根据涉及词语的相关性动态调整 n-gram 匹配的贡献度。
  • 通过在带噪声的训练数据上训练 QA 模型,并测量其在测试集上的性能,进行外部评估,比较 BLEU 和 Q-BLEU 对噪声问题感知质量的判断。
  • 在三个数据集(SQuAD、WikiMovies、VQA)中使用相同的噪声模式,以确保在不同 AQG 来源上的评估一致性。

实验结果

研究问题

  • RQ1标准的基于 n-gram 的度量方法(如 BLEU、METEOR 和 NIST)是否与人类对自动问题生成中问题可回答性的判断具有良好相关性?
  • RQ2Wh-词、命名实体和关系等关键信息成分的存在,在多大程度上影响了生成问题的可回答性?
  • RQ3能否有效将捕捉可回答性的可学习组件整合到现有度量中,以提高其与人类判断的相关性?
  • RQ4当用于训练数据过滤时,改进后的度量方法(Q-BLEU)是否能通过下游 QA 模型性能的提升,实现对 AQG 系统更好的选择?
  • RQ5不同类型的噪声(如移除停用词与移除 Wh-词)对标准度量方法与人类判断下问题感知质量的影响有何差异?

主要发现

  • 标准的 n-gram 度量方法(如 BLEU)与人类对可回答性的判断相关性较弱,在 SQuAD、WikiMovies 和 VQA 数据集中相关系数大多低于 0.5。
  • 所提出的 Q-BLEU 度量方法通过整合可学习的可回答性权重,与人类判断的相关性显著高于标准度量方法,尤其在文档问答和视觉问答任务中表现更优。
  • 外部评估表明,使用 Q-BLEU 进行数据过滤后训练的模型,其下游性能优于使用 BLEU 进行过滤的模型,表明 Q-BLEU 更好地识别出有用的训练样本。
  • 停用词对 BLEU 分数的影响被显著高估,但对可回答性或下游 QA 性能影响极小,凸显了标准度量方法的关键缺陷。
  • 利用人类判断训练的可回答性预测模型,在识别出对可回答性最关键的问题成分(如 Wh-词、实体)方面表现出高准确率。
  • Q-BLEU 度量在预测模型在测试集上的表现方面优于 BLEU4,高 Q-BLEU 分数始终与更好的泛化能力相关,尤其在 SQuAD 和 VQA 数据集中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。