Skip to main content
QUICK REVIEW

[论文解读] Discourse Comprehension: A Question Answering Framework to Represent Sentence Connections

Wei-Jen Ko, Cutter Dalton|arXiv (Cornell University)|Nov 1, 2021
Topic Modeling被引用 7
一句话总结

本文提出了DCQA,一种新颖的问答框架,通过收集基于先前上下文的开放式、自由形式问题,捕捉新闻文章中句子之间的语篇和语义联系。采用可扩展的众包范式,标注者根据答案句生成问题,DCQA支持整体语篇理解的训练,使用Longformer基线模型在该任务上达到67%的准确率,并在生成合成不可回答问题的开放式问答任务中展现出潜力。

ABSTRACT

While there has been substantial progress in text comprehension through simple factoid question answering, more holistic comprehension of a discourse still presents a major challenge (Dunietz et al., 2020). Someone critically reflecting on a text as they read it will pose curiosity-driven, often open-ended questions, which reflect deep understanding of the content and require complex reasoning to answer (Ko et al., 2020; Westera et al., 2020). A key challenge in building and evaluating models for this type of discourse comprehension is the lack of annotated data, especially since collecting answers to such questions requires high cognitive load for annotators. This paper presents a novel paradigm that enables scalable data collection targeting the comprehension of news documents, viewing these questions through the lens of discourse. The resulting corpus, DCQA (Discourse Comprehension by Question Answering), captures both discourse and semantic links between sentences in the form of free-form, open-ended questions. On an evaluation set that we annotated on questions from Ko et al. (2020), we show that DCQA provides valuable supervision for answering open-ended questions. We additionally design pre-training methods utilizing existing question-answering resources, and use synthetic data to accommodate unanswerable questions.

研究动机与目标

  • 为解决在整体语篇理解任务中缺乏标注数据以训练模型的问题,特别是针对开放式、上下文相关的问答问题。
  • 开发一种可扩展的数据收集范式,生成反映语篇层面推理而非简单事实性查询的自由形式开放式问题。
  • 创建一个新的数据集DCQA,通过源自真实新闻文章的问答对,捕捉句子之间的语义和语篇联系。
  • 评估DCQA是否能为训练模型回答复杂、源于好奇心的问答问题提供有效监督,此类问题与人类读者生成的问题类似。
  • 探索处理不可回答问题的方法,通过生成合成数据并将可回答性预测整合到端到端系统中。

提出的方法

  • 采用一种新颖的众包范式:标注者基于前序锚定句生成一个由给定句子回答的问题,而非回答预设问题。
  • 该框架收集的问题反映了句子在语篇中的功能作用,捕捉句子之间的语义和语篇层面关系。
  • 使用现有问答数据集(SQuAD、Natural Questions)和DCQA数据进行预训练,以提升在语篇问答任务上的零样本和少样本性能。
  • 通过在答案句之前截断文章来生成合成的不可回答问题,保持文本连贯性的同时支持可回答性预测的训练。
  • 实施两阶段流水线:首先使用分类器预测问题是否可回答,然后使用问答模型生成答案。
  • 在inquisitive和TED-Q数据集上评估系统,性能通过F1分数和可回答性预测准确率进行衡量。

实验结果

研究问题

  • RQ1基于语篇驱动的开放式问题的问答框架,能否有效捕捉新闻文章中句子之间的语义和语篇层面联系?
  • RQ2所提出的“先见答案再生成问题”的数据收集范式,是否能产生可扩展且多样化的高质量、上下文相关的开放式问题?
  • RQ3DCQA数据和预训练策略能否提升开放式问答任务的性能,特别是那些需要超越事实抽取的复杂推理能力的任务?
  • RQ4在语篇理解中,生成合成数据以建模不可回答问题的效率如何?可回答性预测的瓶颈在哪里?
  • RQ5DCQA框架在多大程度上能泛化到现实世界中人类生成的语篇问答问题,例如inquisitive数据集中的问题?

主要发现

  • Longformer基线模型在DCQA问答任务上达到67%的准确率,接近人类水平的72.2%,表明DCQA为语篇理解提供了强有力的监督信号。
  • 当答案与锚定点距离较远时,模型性能显著下降,凸显了长距离语篇推理的挑战。
  • 在inquisitive数据集上,使用DCQA和预训练数据后,F1分数从0.260提升至0.358,表明性能显著改善。
  • 在合成语篇问题上,可回答性预测准确率达到84%,但在真实inquisitive问题上仅为67%,表明存在显著的泛化差距,是流水线中的关键瓶颈。
  • 结合可回答性预测与答案生成的流水线系统在inquisitive测试集上达到F1分数0.358,证明了该方法的可行性,尽管仍面临挑战。
  • 不可回答问题的合成数据生成方法有效但不足以实现稳健的可回答性预测,提示未来工作需采用更优策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。