Skip to main content
QUICK REVIEW

[论文解读] Towards Automatic Generation of Questions from Long Answers

Shlok Mishra, Pranav Goel|arXiv (Cornell University)|Apr 10, 2020
Topic Modeling参考文献 57被引用 7
一句话总结

本文提出了首个基于 Google Natural Questions 数据集的长答案(4+ 句子)自动问题生成(AQG)基准,表明现有 AQG 模型——尤其是基于 Transformer 的模型——在答案长度增加时性能显著下降。研究发现,尽管 Transformer 模型在自动评估和人工评估中均优于 RNN 模型,但性能仍随上下文变长而下降,凸显长答案 QG 仍是一个具有挑战性的开放性问题。

ABSTRACT

Automatic question generation (AQG) has broad applicability in domains such as tutoring systems, conversational agents, healthcare literacy, and information retrieval. Existing efforts at AQG have been limited to short answer lengths of up to two or three sentences. However, several real-world applications require question generation from answers that span several sentences. Therefore, we propose a novel evaluation benchmark to assess the performance of existing AQG systems for long-text answers. We leverage the large-scale open-source Google Natural Questions dataset to create the aforementioned long-answer AQG benchmark. We empirically demonstrate that the performance of existing AQG methods significantly degrades as the length of the answer increases. Transformer-based methods outperform other existing AQG methods on long answers in terms of automatic as well as human evaluation. However, we still observe degradation in the performance of our best performing models with increasing sentence length, suggesting that long answer QA is a challenging benchmark task for future research.

研究动机与目标

  • 为解决当前自动问题生成(AQG)在长答案(4+ 句子)场景下缺乏大规模数据集和基准的问题。
  • 评估现有 AQG 模型在长答案输入下的表现,此类输入在教育、医疗和信息检索领域中十分常见。
  • 探究既有的 AQG 技术——尤其是依赖复制机制的方法——是否能有效泛化到长答案场景。
  • 探索将答案摘要和结构化特征(如首句)作为辅助输入在长答案 QG 中的影响。

提出的方法

  • 基于 Google Natural Questions(NQ)数据集构建了长答案 AQG 基准,该数据集包含来自维基百科段落的长答案片段。
  • 在长答案设置下,评估了多种现有的 AQG 模型,包括基于 RNN 的序列到序列模型和基于 Transformer 的模型。
  • 采用多源 Transformer 架构,将长答案与额外信号(如摘要或首句)作为输入,以提升生成效果。
  • 使用自动评估指标(BLEU、ROUGE)和人工评估来衡量不同答案长度下的问题质量。
  • 对比了复制机制与指针网络在长答案生成中的有效性,与它们在短答案设置中的成功表现形成对照。

实验结果

研究问题

  • RQ1与短答案相比,现有 AQG 模型在生成长答案(4+ 句子)问题时的表现如何?
  • RQ2在长答案问题生成设置中,基于 Transformer 的模型是否优于基于 RNN 的模型?
  • RQ3将答案摘要或首句作为辅助输入,是否能提升长答案问题生成的质量?
  • RQ4为何在短答案 AQG 中表现有效的复制机制,在长答案生成中会失效或导致性能下降?

主要发现

  • 在长答案问题生成任务中,基于 Transformer 的模型在自动评估指标(BLEU、ROUGE)和人工评估中均显著优于基于 RNN 的模型。
  • 所有 AQG 模型,包括表现最佳的 Transformer 模型,其性能均随答案长度增加而下降,表明长答案 QG 仍是一个具有挑战性的任务。
  • 复制机制在短答案生成中表现良好,但在长答案设置中不仅无益,反而可能损害性能。
  • 将答案摘要句或首句作为辅助输入,并未提升模型性能,表明此类信号在长上下文生成中作用有限。
  • 本研究首次基于 Google Natural Questions 语料库建立了全面的长答案问题生成基准,为该尚未充分探索的研究方向提供了未来研究基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。