Skip to main content
QUICK REVIEW

[论文解读] Attention-guided Generative Models for Extractive Question Answering

Peng Xu, Davis Liang|arXiv (Cornell University)|Oct 12, 2021
Topic Modeling参考文献 29被引用 11
一句话总结

本文提出一种方法,通过利用预训练生成式问答模型中的交叉注意力模式,从模型中提取答案片段,从而在不增加参数的情况下实现抽取式问答。通过联合训练生成式与抽取式目标,该模型在开放域问答任务上实现了最先进性能,参数量更少,并通过注意力引导的片段回退机制实现无幻觉推理。

ABSTRACT

We propose a novel method for applying Transformer models to extractive question answering (QA) tasks. Recently, pretrained generative sequence-to-sequence (seq2seq) models have achieved great success in question answering. Contributing to the success of these models are internal attention mechanisms such as cross-attention. We propose a simple strategy to obtain an extractive answer span from the generative model by leveraging the decoder cross-attention patterns. Viewing cross-attention as an architectural prior, we apply joint training to further improve QA performance. Empirical results show that on open-domain question answering datasets like NaturalQuestions and TriviaQA, our method approaches state-of-the-art performance on both generative and extractive inference, all while using much fewer parameters. Furthermore, this strategy allows us to perform hallucination-free inference while conferring significant improvements to the model's ability to rerank relevant passages.

研究动机与目标

  • 利用预训练生成式模型中的交叉注意力模式,作为内置的架构先验,用于抽取答案片段预测。
  • 通过联合训练生成式与抽取式目标,提升抽取式与生成式问答任务的性能。
  • 通过使用与交叉注意力对齐的片段作为回退机制,减少生成式问答中的幻觉现象。
  • 利用交叉注意力得分作为段落相关性的代理指标,以增强段落重排序。
  • 通过揭示基于注意力的证据,提升黑箱生成式问答系统可解释性。

提出的方法

  • 利用解码器中生成标记与输入上下文标记之间的交叉注意力权重,识别与答案最相关的上下文片段。
  • 应用可微的片段抽取损失,鼓励在联合训练过程中交叉注意力与真实答案片段对齐。
  • 使用单一的序列到序列Transformer模型进行训练,损失函数结合标准交叉熵(用于生成)与基于注意力对齐的片段抽取损失。
  • 当生成输出脱离上下文或产生幻觉时,使用Top-k注意力加权的上下文标记作为回退答案。
  • 通过计算答案相关标记上的注意力权重总和,生成段落得分,用于重排序检索到的段落。
  • 将注意力机制作为弱监督信号用于段落检索,无需额外训练即可提升重排序性能。

实验结果

研究问题

  • RQ1能否在不修改架构的前提下,利用生成式问答模型中的交叉注意力模式提取精确答案片段?
  • RQ2在生成式与抽取式目标上联合训练,是否能同时提升抽取式与生成式问答任务的性能?
  • RQ3基于注意力的片段抽取能否作为有效回退机制,防止生成式问答中的幻觉?
  • RQ4交叉注意力得分能否作为检索系统中段落相关性的可靠代理?
  • RQ5在开放域设置下,使用注意力模式是否能提升生成式问答模型的可解释性?

主要发现

  • 所提出的注意力引导片段抽取方法在参数量显著更少的情况下,实现了与最先进抽取式模型相当的抽取式问答性能。
  • 在NaturalQuestions与TriviaQA数据集上,该模型使用单一统一架构,在生成式与抽取式推理上均达到最先进性能。
  • 通过使用与交叉注意力对齐的片段作为回退机制,该方法有效减少了幻觉现象,提升了工业级问答系统的可靠性。
  • 交叉注意力得分可作为段落相关性的有效代理指标,相较于先前的神经检索基线,显著提升了段落重排序性能。
  • 在FiD模型上,联合训练加入抽取式监督后,段落重排序准确率提升了5.5个百分点,如表4所示。
  • 该方法通过揭示基于证据的注意力模式,增强了模型可解释性,使生成式问答结果更具透明度与可信度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。