Skip to main content
QUICK REVIEW

[论文解读] QAConv: Question Answering on Informative Conversations

Chien-Sheng Wu, Andrea Madotto|arXiv (Cornell University)|May 14, 2021
Topic Modeling被引用 10
一句话总结

本文提出了 QAConv,一个基于长篇、复杂、信息丰富的对话(如商务邮件、 panel 讨论和工作群组对话)的新问答数据集。该研究采用多阶段流水线,结合问题生成与对话摘要技术,收集了 34,608 个经人工验证的问答对。通过两种评估模式——片段模式与完整模式——揭示了现有问答模型在性能上的显著差距,凸显了对话式问答相较于文档式问答的挑战性。

ABSTRACT

This paper introduces QAConv, a new question answering (QA) dataset that uses conversations as a knowledge source. We focus on informative conversations, including business emails, panel discussions, and work channels. Unlike open-domain and task-oriented dialogues, these conversations are usually long, complex, asynchronous, and involve strong domain knowledge. In total, we collect 34,608 QA pairs from 10,259 selected conversations with both human-written and machine-generated questions. We use a question generator and a dialogue summarizer as auxiliary tools to collect and recommend questions. The dataset has two testing scenarios: chunk mode and full mode, depending on whether the grounded partial conversation is provided or retrieved. Experimental results show that state-of-the-art pretrained QA systems have limited zero-shot performance and tend to predict our questions as unanswerable. Our dataset provides a new training and evaluation testbed to facilitate QA on conversations research.

研究动机与目标

  • 解决在长篇、复杂、信息丰富的对话(如邮件、panel 讨论和工作群组对话)上问答任务缺乏训练与评估数据的问题。
  • 克服对话式问答中信息分散于多位发言者、复杂代词指代以及监督信号不足的挑战。
  • 利用问题生成与对话摘要技术,开发可扩展的数据收集流水线,生成高质量、经人工验证的问答对。
  • 建立两种不同的评估场景——片段模式与完整模式——以评估问答模型在对话知识源上的零样本与微调性能。
  • 提供一个新基准,用于评估并推动对话式问答技术的最先进水平,尤其针对非任务导向、领域丰富的对话。

提出的方法

  • 从真实世界来源收集 10,259 个信息丰富的对话:商务邮件、panel 讨论和工作群组对话(如 Slack、Zoom)。
  • 将长对话分割为较短的对话片段,以促进人工标注与机器生成问答对。
  • 训练多跳问题生成模型与对话摘要模型,以生成机器生成的问答对。
  • 通过 Amazon Mechanical Turk 的众包方式收集人工编写的问答对,并验证不确定的机器生成问答对。
  • 应用问答模型识别模糊或低质量样本,并进行额外的人工验证步骤,以确保数据质量。
  • 将最终数据集划分为训练集、验证集与测试集,包含两种评估模式:(1) 片段模式(提供部分上下文)与 (2) 完整模式(需检索)。

实验结果

研究问题

  • RQ1问题生成与对话摘要流水线在生成信息丰富对话中高质量、多样化问答对方面的有效性如何?
  • RQ2当前最先进的预训练问答模型在对话式问答任务中,特别是在零样本设置下的泛化能力如何?
  • RQ3文档式问答(如 Wikipedia)与长篇、多轮、领域丰富的对话式问答之间,性能差距有多大?
  • RQ4在完整模式下,即需要在回答前进行对话检索的设置中,检索增强型问答模型表现如何?
  • RQ5在对话语境中回答多跳与代词密集型问题时,主要的失败模式与挑战是什么?

主要发现

  • 在 SQuAD 2.0 上微调的最先进跨度抽取模型(如 RoBERTa-Large)在 QAConv 上的零样本性能有限,常将问题判定为不可回答。
  • 生成式模型(如 UnifiedQA)表现出更好的泛化能力,但在对话语境下的复杂多跳问题上仍表现不佳。
  • 文档式问答与对话式问答之间的性能差距显著,QAConv 上的准确率相比标准基准显著下降。
  • 完整模式(需检索)相比片段模式导致性能明显下降,表明检索是主要瓶颈。
  • 多跨度与多跳问题尤其具有挑战性,模型常因无法解析代词指代或整合多位发言者的信息而失败。
  • 人工评估确认,问题生成流水线能够生成高质量、多样化且上下文相关的问答对,验证了数据收集方法的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。