Skip to main content
QUICK REVIEW

[论文解读] ELI5: Long Form Question Answering

Angela Fan, Yacine Jernite|arXiv (Cornell University)|Jul 22, 2019
Topic Modeling参考文献 25被引用 14
一句话总结

本文提出了ELI5,一个包含270K个Reddit帖子的大规模数据集,用于长篇问答任务,其中模型需对复杂开放式问题生成多句、摘要式解释。该研究提出一种多任务学习方法,使用在语言建模、掩码词预测和答案生成任务上训练的Seq2Seq模型,实现了最先进性能,但人工评估显示人类标注的答案在86%的情况下更受青睐,凸显了在长上下文理解与生成方面仍有巨大改进空间。

ABSTRACT

We introduce the first large-scale corpus for long-form question answering, a task requiring elaborate and in-depth answers to open-ended questions. The dataset comprises 270K threads from the Reddit forum ``Explain Like I'm Five'' (ELI5) where an online community provides answers to questions which are comprehensible by five year olds. Compared to existing datasets, ELI5 comprises diverse questions requiring multi-sentence answers. We provide a large set of web documents to help answer the question. Automatic and human evaluations show that an abstractive model trained with a multi-task objective outperforms conventional Seq2Seq, language modeling, as well as a strong extractive baseline. However, our best model is still far from human performance since raters prefer gold responses in over 86% of cases, leaving ample opportunity for future improvement.

研究动机与目标

  • 为解决缺乏大规模数据集以支持需要多句摘要式回答的长篇开放式问答任务的问题。
  • 研究从长篇、多样化网络文档中检索并整合信息以生成全面答案的挑战。
  • 开发并评估一种多任务学习框架,以提升长篇问答中的摘要式生成能力。
  • 在该新任务上对抽取式、检索式和生成式模型的性能进行基准测试,重点关注长上下文理解与长篇输出生成能力。

提出的方法

  • ELI5数据集源自Reddit的'Explain Like I'm Five'论坛中的270K个帖子,用户为复杂问题提供简化解释,形成段落长度的答案。
  • 每个样本包含一个问题、支持性网络文档(平均约1070个词),以及一个标准答案(平均130.6个词)。
  • 提出一种多任务学习目标,使用相同数据联合训练单个Seq2Seq模型完成三项任务:语言建模、掩码词预测和答案生成。
  • 模型架构基于基于Transformer的编码器-解码器框架,通过端到端微调多任务目标,以提升泛化能力和摘要式生成性能。
  • 评估采用自动指标(ROUGE)与人工标注,评分者在86%的情况下更偏好标准答案而非模型输出。
  • 基线模型包括标准Seq2Seq、语言建模模型,以及使用BidAF构建的强基线抽取式模型,并扩展至多句输出。

实验结果

研究问题

  • RQ1与标准Seq2Seq和语言建模基线相比,多任务学习方法是否能显著提升摘要式长篇问答性能?
  • RQ2现有抽取式与检索式模型在长篇多句答案生成任务上的泛化能力如何?
  • RQ3当前最先进神经模型与人工撰写答案在长篇问答任务中的性能差距有多大?
  • RQ4模型性能在多大程度上受限于其对长篇多文档输入的理解能力以及生成连贯、全面回答的能力?
  • RQ5自动指标如ROUGE在评估长篇答案质量时与人工判断的相关性如何?

主要发现

  • 多任务学习方法在自动指标(ROUGE)和人工评估指标上均显著优于传统Seq2Seq和语言建模基线。
  • 表现最佳的模型仅在14%的情况下获得人工评分者的偏好,表明其与人类表现之间仍存在巨大差距。
  • 人工评估显示,标准答案在86%的情况下优于模型输出,凸显了该任务的难度及未来改进的迫切需求。
  • 模型性能严重受限于其对长篇多文档输入的理解能力以及生成连贯、全面长篇回答的能力。
  • ROUGE分数与人工判断存在相关性,但不足以完全捕捉答案质量,凸显了对更精细评估协议的需求。
  • ELI5数据集为长上下文理解与摘要式生成研究提供了支持,为未来开放式多句问答研究提供了基准。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。