Skip to main content
QUICK REVIEW

[论文解读] Gated Group Self-Attention for Answer Selection

Dong Xu, Jianhui Ji|arXiv (Cornell University)|May 26, 2019
Topic Modeling参考文献 33被引用 5
一句话总结

本文提出了一种基于门控分组自注意力(Gated Group Self-Attention, GGSA)的新模型,用于答案选择任务。该模型通过分组自注意力机制与门控机制,区分局部与全局上下文信息。GGSA在两个问答数据集上实现了最先进性能,优于现有的全局自注意力和RNN-based方法,同时降低了计算成本。

ABSTRACT

Answer selection (answer ranking) is one of the key steps in many kinds of question answering (QA) applications, where deep models have achieved state-of-the-art performance. Among these deep models, recurrent neural network (RNN) based models are most popular, typically with better performance than convolutional neural network (CNN) based models. Nevertheless, it is difficult for RNN based models to capture the information about long-range dependency among words in the sentences of questions and answers. In this paper, we propose a new deep model, called gated group self-attention (GGSA), for answer selection. GGSA is inspired by global self-attention which is originally proposed for machine translation and has not been explored in answer selection. GGSA tackles the problem of global self-attention that local and global information cannot be well distinguished. Furthermore, an interaction mechanism between questions and answers is also proposed to enhance GGSA by a residual structure. Experimental results on two popular QA datasets show that GGSA can outperform existing answer selection models to achieve state-of-the-art performance. Furthermore, GGSA can also achieve higher accuracy than global self-attention for the answer selection task, with a lower computation cost.

研究动机与目标

  • 为解决基于RNN的模型在捕捉问题-答案序列中长距离依赖关系方面的局限性。
  • 为克服全局自注意力在答案选择中无法区分局部与全局上下文信息的缺陷。
  • 引入一种基于残差结构的问答间新型交互机制,以改进问题感知表示的建模。
  • 开发一种专为答案选择任务设计的自注意力模型,该任务此前主要由RNN和CNN模型主导。
  • 在答案选择任务中实现比全局自注意力更高的准确率和更低的计算成本。

提出的方法

  • GGSA采用分组自注意力机制,分别建模问题和答案中的局部与全局依赖关系,利用滑动窗口方法定义局部组。
  • 引入全局信息门控机制,动态控制全局上下文信息向最终表示的融合,从而增强长距离依赖关系的建模能力。
  • 模型采用基于残差的交互机制,计算问题感知残差并将其加到答案表示中,使答案能够关注相关的问题内容。
  • 该架构基于多头自注意力与残差连接构建,受Transformer启发,但针对答案选择任务进行了结构化局部-全局区分的适配。
  • 在GGSA之后应用最大池化操作,以获得固定大小的表示用于排序,并评估了成对损失与点对损失两种训练目标。
  • 模型在两个公开的问答数据集上进行端到端训练,并通过消融实验验证各组件的贡献。

实验结果

研究问题

  • RQ1基于自注意力的模型是否能在答案选择任务中超越现有的RNN和CNN-based模型?
  • RQ2在自注意力机制中区分局部与全局上下文信息,是否能提升答案选择任务的性能与效率?
  • RQ3基于残差的问答间交互机制是否能增强答案表示学习?
  • RQ4GGSA与全局自注意力及其他最先进模型相比,在性能与计算成本方面表现如何?
  • RQ5在GGSA中,成对损失与点对损失哪种在答案选择任务中表现更优?

主要发现

  • 在Yahoo!QA数据集上,GGSA使用成对损失时P@1得分为78.45%,达到最先进水平。
  • 在同一数据集中,GGSA使用成对损失的性能优于点对损失变体,P@1得分更高(78.45% vs. 74.26%),MRR也更优(85.07% vs. 86.28%),尽管MRR存在权衡。
  • GGSA在准确率上优于全局自注意力,同时计算成本更低,展现出高效与有效兼具的优势。
  • 消融实验确认,分组自注意力与残差交互机制均对性能提升有显著贡献。
  • 成对损失在P@1指标上表现更优,而点对损失在MRR指标上更优,表明不同排序指标之间存在权衡。
  • GGSA是首个专为答案选择任务设计的自注意力模型,在两个标准数据集上建立了新的最先进基准。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。