[论文解读] QAConv: Question Answering on Informative Conversations
本文提出了 QAConv,一个基于长篇、复杂、信息丰富的对话(如商务邮件、 panel 讨论和工作群组对话)的新问答数据集。该研究采用多阶段流水线,结合问题生成与对话摘要技术,收集了 34,608 个经人工验证的问答对。通过两种评估模式——片段模式与完整模式——揭示了现有问答模型在性能上的显著差距,凸显了对话式问答相较于文档式问答的挑战性。
This paper introduces QAConv, a new question answering (QA) dataset that uses conversations as a knowledge source. We focus on informative conversations, including business emails, panel discussions, and work channels. Unlike open-domain and task-oriented dialogues, these conversations are usually long, complex, asynchronous, and involve strong domain knowledge. In total, we collect 34,608 QA pairs from 10,259 selected conversations with both human-written and machine-generated questions. We use a question generator and a dialogue summarizer as auxiliary tools to collect and recommend questions. The dataset has two testing scenarios: chunk mode and full mode, depending on whether the grounded partial conversation is provided or retrieved. Experimental results show that state-of-the-art pretrained QA systems have limited zero-shot performance and tend to predict our questions as unanswerable. Our dataset provides a new training and evaluation testbed to facilitate QA on conversations research.
研究动机与目标
- 解决在长篇、复杂、信息丰富的对话(如邮件、panel 讨论和工作群组对话)上问答任务缺乏训练与评估数据的问题。
- 克服对话式问答中信息分散于多位发言者、复杂代词指代以及监督信号不足的挑战。
- 利用问题生成与对话摘要技术,开发可扩展的数据收集流水线,生成高质量、经人工验证的问答对。
- 建立两种不同的评估场景——片段模式与完整模式——以评估问答模型在对话知识源上的零样本与微调性能。
- 提供一个新基准,用于评估并推动对话式问答技术的最先进水平,尤其针对非任务导向、领域丰富的对话。
提出的方法
- 从真实世界来源收集 10,259 个信息丰富的对话:商务邮件、panel 讨论和工作群组对话(如 Slack、Zoom)。
- 将长对话分割为较短的对话片段,以促进人工标注与机器生成问答对。
- 训练多跳问题生成模型与对话摘要模型,以生成机器生成的问答对。
- 通过 Amazon Mechanical Turk 的众包方式收集人工编写的问答对,并验证不确定的机器生成问答对。
- 应用问答模型识别模糊或低质量样本,并进行额外的人工验证步骤,以确保数据质量。
- 将最终数据集划分为训练集、验证集与测试集,包含两种评估模式:(1) 片段模式(提供部分上下文)与 (2) 完整模式(需检索)。
实验结果
研究问题
- RQ1问题生成与对话摘要流水线在生成信息丰富对话中高质量、多样化问答对方面的有效性如何?
- RQ2当前最先进的预训练问答模型在对话式问答任务中,特别是在零样本设置下的泛化能力如何?
- RQ3文档式问答(如 Wikipedia)与长篇、多轮、领域丰富的对话式问答之间,性能差距有多大?
- RQ4在完整模式下,即需要在回答前进行对话检索的设置中,检索增强型问答模型表现如何?
- RQ5在对话语境中回答多跳与代词密集型问题时,主要的失败模式与挑战是什么?
主要发现
- 在 SQuAD 2.0 上微调的最先进跨度抽取模型(如 RoBERTa-Large)在 QAConv 上的零样本性能有限,常将问题判定为不可回答。
- 生成式模型(如 UnifiedQA)表现出更好的泛化能力,但在对话语境下的复杂多跳问题上仍表现不佳。
- 文档式问答与对话式问答之间的性能差距显著,QAConv 上的准确率相比标准基准显著下降。
- 完整模式(需检索)相比片段模式导致性能明显下降,表明检索是主要瓶颈。
- 多跨度与多跳问题尤其具有挑战性,模型常因无法解析代词指代或整合多位发言者的信息而失败。
- 人工评估确认,问题生成流水线能够生成高质量、多样化且上下文相关的问答对,验证了数据收集方法的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。