[论文解读] Generating Followup Questions for Interpretable Multi-hop Question Answering
本文提出一种神经框架,用于在多跳问答中生成可解释的后续问题,利用指针-生成网络基于部分证据生成相关子问题。该方法在双跳设置下相比基线模型将答案准确率提升了8.9% F1,表明学习得到的后续问题能增强检索的精确性与模型的可解释性,且无需依赖人工设计的规则。
We propose a framework for answering open domain multi-hop questions in which partial information is read and used to generate followup questions, to finally be answered by a pretrained single-hop answer extractor. This framework makes each hop interpretable, and makes the retrieval associated with later hops as flexible and specific as for the first hop. As a first instantiation of this framework, we train a pointer-generator network to predict followup questions based on the question and partial information. This provides a novel application of a neural question generation network, which is applied to give weak ground truth single-hop followup questions based on the final answers and their supporting facts. Learning to generate followup questions that select the relevant answer spans against downstream supporting facts, while avoiding distracting premises, poses an exciting semantic challenge for text generation. We present an evaluation using the two-hop bridge questions of HotpotQA.
研究动机与目标
- 为解决在多跳问答中生成有意义且可解释的后续问题的挑战,特别是针对需要中间推理的桥接型问题。
- 开发一个完全训练好的、端到端可微的后续问题生成器,避免依赖人工设计的规则或启发式方法。
- 评估生成的后续问题在去噪设置下提升答案提取准确率的有效性。
- 建立一种新颖的评估协议,利用答案提取器的弱监督对后续问题生成进行评估。
- 探索如何将神经问题生成方法调整为生成能引导检索聚焦于相关支持事实的问题。
提出的方法
- 使用指针-生成网络,基于原始问题和第一跳的部分支持证据训练生成后续问题。
- 模型采用序列到序列架构,结合覆盖机制和复制机制,以生成流畅且事实准确的问题。
- 训练采用弱监督:通过判断一个冻结的单跳答案提取器是否能从第二跳证据中正确提取最终答案,来评估生成问题的质量。
- 系统采用控制器模块,将检索到的段落分类为无关、包含最终答案,或包含中间信息。
- 该流程迭代地将原始问题简化为更简单的子问题,每一轮均使用预训练的单跳模型进行答案提取。
- 采用虚拟设置(oracle setting)以隔离后续问题生成器的性能,假设支持事实被完美检索。
实验结果
研究问题
- RQ1神经问题生成器能否学习生成既通顺又在语义上与原始问题所缺信息相匹配的后续问题?
- RQ2与直接单跳检索或简单复用原始问题相比,生成后续问题是否能提升答案准确率?
- RQ3在多跳问答中,后续问题生成器在不同类型桥接问题上的性能表现如何?
- RQ4来自答案提取器的弱监督在多大程度上能提升生成的后续问题的质量?
- RQ5生成的后续问题能否有效引导检索,避免干扰前提,同时聚焦于相关支持事实?
主要发现
- 训练后的后续问题生成器相比复用原始问题的基线模型,F1分数提升了8.9个百分点,证明了上下文感知子问题生成的价值。
- 采用“Q1 else Q2”策略——若可能则用Q1回答,否则使用Q2——取得了最高性能,在过滤后的开发集上分别达到34.7 F1和43.8 F1。
- 在70%的情况下,模型成功生成了相关后续问题,表现为能从第二跳证据中正确提取答案,即使原始问题存在歧义或信息不足。
- 系统在第二跳生成了1,180个后续查询,其中答案提取器成功从975个中提取了答案,显示出在下游应用中的高度可靠性。
- 虚拟评估设置证实,后续问题生成器显著提升了检索的精确性,因为它能避免干扰前提,专注于相关事实。
- 该方法优于仅复用原始问题的简单基线,证明学习到的后续问题在多跳推理中比静态查询更有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。