[论文解读] Attention-guided Generative Models for Extractive Question Answering
本文提出一种方法,通过利用预训练生成式问答模型中的交叉注意力模式,从模型中提取答案片段,从而在不增加参数的情况下实现抽取式问答。通过联合训练生成式与抽取式目标,该模型在开放域问答任务上实现了最先进性能,参数量更少,并通过注意力引导的片段回退机制实现无幻觉推理。
We propose a novel method for applying Transformer models to extractive question answering (QA) tasks. Recently, pretrained generative sequence-to-sequence (seq2seq) models have achieved great success in question answering. Contributing to the success of these models are internal attention mechanisms such as cross-attention. We propose a simple strategy to obtain an extractive answer span from the generative model by leveraging the decoder cross-attention patterns. Viewing cross-attention as an architectural prior, we apply joint training to further improve QA performance. Empirical results show that on open-domain question answering datasets like NaturalQuestions and TriviaQA, our method approaches state-of-the-art performance on both generative and extractive inference, all while using much fewer parameters. Furthermore, this strategy allows us to perform hallucination-free inference while conferring significant improvements to the model's ability to rerank relevant passages.
研究动机与目标
- 利用预训练生成式模型中的交叉注意力模式,作为内置的架构先验,用于抽取答案片段预测。
- 通过联合训练生成式与抽取式目标,提升抽取式与生成式问答任务的性能。
- 通过使用与交叉注意力对齐的片段作为回退机制,减少生成式问答中的幻觉现象。
- 利用交叉注意力得分作为段落相关性的代理指标,以增强段落重排序。
- 通过揭示基于注意力的证据,提升黑箱生成式问答系统可解释性。
提出的方法
- 利用解码器中生成标记与输入上下文标记之间的交叉注意力权重,识别与答案最相关的上下文片段。
- 应用可微的片段抽取损失,鼓励在联合训练过程中交叉注意力与真实答案片段对齐。
- 使用单一的序列到序列Transformer模型进行训练,损失函数结合标准交叉熵(用于生成)与基于注意力对齐的片段抽取损失。
- 当生成输出脱离上下文或产生幻觉时,使用Top-k注意力加权的上下文标记作为回退答案。
- 通过计算答案相关标记上的注意力权重总和,生成段落得分,用于重排序检索到的段落。
- 将注意力机制作为弱监督信号用于段落检索,无需额外训练即可提升重排序性能。
实验结果
研究问题
- RQ1能否在不修改架构的前提下,利用生成式问答模型中的交叉注意力模式提取精确答案片段?
- RQ2在生成式与抽取式目标上联合训练,是否能同时提升抽取式与生成式问答任务的性能?
- RQ3基于注意力的片段抽取能否作为有效回退机制,防止生成式问答中的幻觉?
- RQ4交叉注意力得分能否作为检索系统中段落相关性的可靠代理?
- RQ5在开放域设置下,使用注意力模式是否能提升生成式问答模型的可解释性?
主要发现
- 所提出的注意力引导片段抽取方法在参数量显著更少的情况下,实现了与最先进抽取式模型相当的抽取式问答性能。
- 在NaturalQuestions与TriviaQA数据集上,该模型使用单一统一架构,在生成式与抽取式推理上均达到最先进性能。
- 通过使用与交叉注意力对齐的片段作为回退机制,该方法有效减少了幻觉现象,提升了工业级问答系统的可靠性。
- 交叉注意力得分可作为段落相关性的有效代理指标,相较于先前的神经检索基线,显著提升了段落重排序性能。
- 在FiD模型上,联合训练加入抽取式监督后,段落重排序准确率提升了5.5个百分点,如表4所示。
- 该方法通过揭示基于证据的注意力模式,增强了模型可解释性,使生成式问答结果更具透明度与可信度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。