[论文解读] Variational Self-attention Model for Sentence Representation
该论文提出了一种变分自注意力模型(VSAM),通过变分推断将自注意力权重视为随机变量,实现随机的、多模态的注意力分布。通过边缘化潜在变量,VSAM 提升了对过拟合的鲁棒性,并在立场检测任务上取得最先进性能,在 FNC-1 数据集上达到 83.54% 的 micro-F1,优于确定性自注意力和其他基线模型。
This paper proposes a variational self-attention model (VSAM) that employs variational inference to derive self-attention. We model the self-attention vector as random variables by imposing a probabilistic distribution. The self-attention mechanism summarizes source information as an attention vector by weighted sum, where the weights are a learned probabilistic distribution. Compared with conventional deterministic counterpart, the stochastic units incorporated by VSAM allow multi-modal attention distributions. Furthermore, by marginalizing over the latent variables, VSAM is more robust against overfitting. Experiments on the stance detection task demonstrate the superiority of our method.
研究动机与目标
- 为解决确定性自注意力在捕捉句子表征中复杂、多模态注意力模式方面的局限性。
- 提升在小规模 NLP 数据集上的泛化能力与对过拟合的鲁棒性。
- 通过变分推断将概率建模整合到自注意力中,实现更丰富的、分布式的注意力表征。
- 通过建模注意力权重的不确定性,增强句子表征学习在立场检测任务中的表现。
提出的方法
- VSAM 将自注意力向量建模为具有变分后验分布的潜在随机变量,实现随机注意力计算。
- 采用变分下界(ELBO)通过随机反向传播联合优化生成模型与推理网络。
- 注意力权重从由神经网络基于输入句子表征预测的参数化高斯分布中采样,该网络预测均值与方差。
- 模型使用重参数化技巧实现可微分采样,支持通过反向传播进行端到端训练。
- 生成模型定义了潜在注意力变量的先验分布,而推理网络则利用观测输入与目标标签近似真实后验分布。
- 最终的句子表征通过边缘化潜在注意力变量获得,将不确定性整合到最终输出中。
实验结果
研究问题
- RQ1将自注意力权重建模为随机变量是否能提升 NLP 任务中的句子表征学习?
- RQ2通过变分推断引入随机性是否能产生更鲁棒的注意力分布,以捕捉多模态依赖关系?
- RQ3对潜在注意力变量进行边缘化是否能减少过拟合,特别是在小数据集上?
- RQ4所提出的变分自注意力机制与确定性自注意力在立场检测任务中的表现相比如何?
主要发现
- VSAM 在 FNC-1 立场检测测试集上达到 83.54% 的 micro-F1,优于所有基线模型,包括 CNN、RNN 和确定性自注意力模型。
- 在 'agree' 类上,模型准确率达到 28.53%,显著优于次佳基线模型(CNN 为 24.54%)。
- 在 'unrelated' 类上,VSAM 达到 82.43% 的准确率,超过确定性自注意力模型(80.34%)与 CNN 基线(79.53%)。
- 性能提升归因于模型通过随机推理学习多模态注意力分布的能力,从而提升了表征质量。
- 实验结果证实,对潜在变量进行边缘化可提升鲁棒性,尤其在训练样本有限的小规模数据集上具有显著优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。