[论文解读] Open-Domain Conversational Question Answering with Historical Answers
该论文提出 ConvADR-QA,一种新颖的开放域对话式问答框架,通过将历史答案作为直接输入信号,增强密集检索与答案生成。通过利用阅读模型预测的答案来改进文档检索,该方法在 OR-QuAC 基准测试中,无论在抽取式还是生成式设置下,均取得了新的 SOTA 性能,证明历史答案能显著提升检索与答案生成的准确性。
Open-domain conversational question answering can be viewed as two tasks: passage retrieval and conversational question answering, where the former relies on selecting candidate passages from a large corpus and the latter requires better understanding of a question with contexts to predict the answers. This paper proposes ConvADR-QA that leverages historical answers to boost retrieval performance and further achieves better answering performance. In our proposed framework, the retrievers use a teacher-student framework to reduce noises from previous turns. Our experiments on the benchmark dataset, OR-QuAC, demonstrate that our model outperforms existing baselines in both extractive and generative reader settings, well justifying the effectiveness of historical answers for open-domain conversational question answering.
研究动机与目标
- 通过在检索过程中显式引入历史答案作为信号,提升开放域对话式问答性能。
- 解决多轮对话系统中仅依赖历史问题可能无法捕捉语义连贯性的问题。
- 在存在数百万候选文档的开放域设置中,提升检索性能,其中密集检索至关重要。
- 证明预测的答案(而非仅问题)可作为有效监督信号,以改善文档检索。
- 通过简单而有效的设计,在抽取式与生成式答案生成设置中均实现 SOTA 性能。
提出的方法
- 该模型通过在文档检索过程中将预测的历史答案整合到查询表示中,扩展了密集检索。
- 采用两阶段流程:首先,使用融合历史答案的查询,由密集检索器检索相关文档;其次,阅读模型(抽取式或生成式)从检索到的文档中预测答案。
- 阅读模型(如基于 BERT 的抽取式阅读器或 FiD 生成式 QA 模型)生成答案,随后将这些答案用作下一轮检索的输入信号。
- 该方法通过利用阅读模型的输出来优化检索器的输入,借鉴知识蒸馏原理,实现答案信号的前向传播。
- 该方法避免使用复杂的图结构或额外参数,而是直接将预测答案整合到检索查询中。
- 该方法与现有强基线模型(如 ORConvQA 和 FiD)兼容,可实现即插即用的性能提升。
实验结果
研究问题
- RQ1历史答案能否提升开放域对话式问答中的文档检索性能?
- RQ2将预测的答案作为输入信号,是否能相比仅依赖历史问题,带来更好的答案生成效果?
- RQ3预测答案的质量如何影响整体检索与答案生成性能?
- RQ4简单地整合答案信号是否能超越更复杂的图引导检索方法?
- RQ5低质量答案预测带来的误差传播对检索有效性有何影响?
主要发现
- ConvADR-QA 在 OR-QuAC 基准测试中,无论在抽取式还是生成式 QA 设置下,均取得了新的 SOTA 性能。
- 该模型在检索 MRR@5 和答案生成指标上均优于所有基线模型,证明使用历史答案作为检索信号的有效性。
- 与仅使用历史问题的基线相比,使用预测答案显著提升了检索性能,MRR@5 显著提高。
- 使用真实答案(gold 历史答案)的“理想设置”性能高于使用预测答案,证实答案质量直接影响检索成功率。
- 观察到误差传播现象:当使用弱阅读模型(如 FiD)时,检索性能下降,表明答案质量影响检索准确性。
- 定性分析显示,历史答案直接影响答案预测,ConvADR-QA 能正确生成与先前回答一致的答案,而 ConvDR 常常无法保持一致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。