[论文解读] Understanding and Improving Zero-shot Multi-hop Reasoning in Generative Question Answering
本文研究生成式问答(QA)模型中的零样本多跳推理,发现模型无法从单跳问题泛化到多跳问题。本文提出两种方法——将单跳问题拼接和在SPARQL逻辑形式上微调——以提升零样本多跳推理性能,效果显著,尤其在两者结合时更为突出。
Generative question answering (QA) models generate answers to questions either solely based on the parameters of the model (the closed-book setting) or additionally retrieving relevant evidence (the open-book setting). Generative QA models can answer some relatively complex questions, but the mechanism through which they do so is still poorly understood. We perform several studies aimed at better understanding the multi-hop reasoning capabilities of generative QA models. First, we decompose multi-hop questions into multiple corresponding single-hop questions, and find marked inconsistency in QA models' answers on these pairs of ostensibly identical question chains. Second, we find that models lack zero-shot multi-hop reasoning ability: when trained only on single-hop questions, models generalize poorly to multi-hop questions. Finally, we demonstrate that it is possible to improve models' zero-shot multi-hop reasoning capacity through two methods that approximate real multi-hop natural language (NL) questions by training on either concatenation of single-hop questions or logical forms (SPARQL). In sum, these results demonstrate that multi-hop reasoning does not emerge naturally in generative QA models, but can be encouraged by advances in training or modeling techniques.
研究动机与目标
- 探究生成式QA模型在仅用单跳问题进行训练的情况下,是否能实现稳健的零样本多跳推理。
- 分析模型在将多跳问题分解为单跳组件时,回答的一致性与正确性。
- 评估通过拼接单跳问题或SPARQL查询等方式对多跳问题的近似方法,是否能提升零样本多跳推理能力。
- 探索在结构化逻辑形式(SPARQL)上进行训练,是否能实现向自然语言多跳问题的泛化。
- 识别当前生成式QA模型在组合推理方面的局限性,并提出可扩展的训练技术以提升零样本多跳推理性能。
提出的方法
- 使用启发式方法将多跳QA问题分解为单跳问题链,以探测模型的一致性。
- 通过拼接单跳问题对生成式QA模型(UnifiedQA和RAG)进行训练,以近似多跳推理模式。
- 基于多跳问题生成的SPARQL查询对模型进行微调,以传授显式的组合推理结构。
- 联合使用两种监督信号(拼接的自然语言问题和SPARQL),以共同提升零样本多跳推理能力。
- 使用预训练语言模型结合序列到序列生成,基于问题嵌入和上下文(开放书设置)生成答案。
- 通过在微调后测试单跳和多跳问题的性能,与零样本基线进行比较,评估泛化能力。
实验结果
研究问题
- RQ1分解后的单跳问题的正确性是否是多跳问题正确的必要且充分条件?
- RQ2生成式QA模型在多跳问题及其单跳组件上的回答是否具有一致性?
- RQ3仅在单跳问题上进行训练的模型是否能实现对多跳问题的零样本泛化?
- RQ4在多跳问题的近似方法(如拼接单跳问题或SPARQL逻辑形式)上进行训练,是否能提升零样本多跳推理能力?
- RQ5学习执行SPARQL查询是否能迁移到自然语言多跳问题上的性能提升?
主要发现
- 生成式QA模型在回答分解后的单跳问题与对应多跳问题时表现出显著不一致性,表明其推理存在缺陷,而非可靠的多跳推理能力。
- 仅在单跳问题上训练的模型在多跳问题上表现出极差的零样本泛化能力,无论在封闭书(UnifiedQA)还是开放书(RAG)设置下,性能均显著下降。
- 在拼接单跳问题上进行训练可提升零样本多跳推理性能,在ComplexWebQuestions数据集上,UnifiedQA的F1达到25.69,RAG达到53.93,表明该方法是多跳推理的有效近似。
- 在SPARQL查询上进行微调可使模型泛化到自然语言多跳问题,其性能仅比在自然语言多跳问题上训练的模型下降7–15 F1点,表明具有很强的迁移能力。
- 结合两种监督信号(拼接的自然语言问题和SPARQL)可带来进一步提升,使UnifiedQA在多跳问题上的F1提高至27.14,表明存在协同增益。
- 尽管性能有所提升,但零样本方法与在真实多跳自然语言问题上微调的模型之间仍存在显著性能差距,凸显了对更好近似方法或建模技术的迫切需求。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。