Skip to main content
QUICK REVIEW

[论文解读] Sparse and Continuous Attention Mechanisms

André F. T. Martins, António Farinhas|arXiv (Cornell University)|Jun 12, 2020
Topic Modeling参考文献 51被引用 10
一句话总结

本文通过在变形指数族和Tsallis统计下将sparsemax和entmax扩展到连续空间,引入了连续域注意力机制,实现了对一维和二维区域的稀疏、可解释注意力。推导了α ∈ {1,2}的高效反向传播算法,在文本分类、机器翻译和视觉问题回答任务中,通过聚焦于紧凑区间和区域而非离散标记或像素,实现了更优的定位效果。

ABSTRACT

Exponential families are widely used in machine learning; they include many distributions in continuous and discrete domains (e.g., Gaussian, Dirichlet, Poisson, and categorical distributions via the softmax transformation). Distributions in each of these families have fixed support. In contrast, for finite domains, there has been recent work on sparse alternatives to softmax (e.g. sparsemax and alpha-entmax), which have varying support, being able to assign zero probability to irrelevant categories. This paper expands that work in two directions: first, we extend alpha-entmax to continuous domains, revealing a link with Tsallis statistics and deformed exponential families. Second, we introduce continuous-domain attention mechanisms, deriving efficient gradient backpropagation algorithms for alpha in {1,2}. Experiments on attention-based text classification, machine translation, and visual question answering illustrate the use of continuous attention in 1D and 2D, showing that it allows attending to time intervals and compact regions.

研究动机与目标

  • 将稀疏注意力机制(如sparsemax、entmax)从离散域扩展到连续域。
  • 建立连续稀疏注意力与Tsallis统计及变形指数族之间的理论联系。
  • 为连续注意力中α ∈ {1,2}的高效反向传播算法提供支持。
  • 在真实世界NLP和视觉任务中(如文本分类、机器翻译和视觉问题回答)展示连续注意力的实用性。
  • 实现注意力机制聚焦于紧凑、连续的区域(如时间区间、图像块),而非单个离散单元。

提出的方法

  • 通过在测度空间中使用变形指数族,将entmax变换推广至连续域,提出连续域的α-entmax。
  • 将连续注意力机制定义为在连续域上对得分函数进行α-entmax变换,生成支持可变的稀疏概率密度。
  • 将变换的雅可比矩阵引入为广义协方差矩阵,通过隐式微分实现高效的梯度计算。
  • 使用温度参数τ控制集中程度,低温度极限下收敛于全局最大值处的Dirac delta函数。
  • 通过在连续时间或空间坐标上定义得分函数,将连续注意力机制应用于一维(文本)和二维(图像)场景。
  • 利用推导出的雅可比结构,在连续注意力层中实现反向传播,支持神经网络中的端到端训练。

实验结果

研究问题

  • RQ1能否将稀疏注意力机制从离散域推广到连续域?
  • RQ2连续稀疏注意力与Tsallis统计或变形指数族之间存在何种理论联系?
  • RQ3如何为α ∈ {1,2}的连续注意力机制实现高效的反向传播?
  • RQ4连续注意力是否能在需要定位紧凑区域的任务中提升可解释性和性能?
  • RQ5在聚焦定位和任务性能方面,连续注意力与离散注意力相比有何差异?

主要发现

  • 连续α-entmax机制生成了支持可变的稀疏注意力分布,实现了对数据中紧凑一维区间或二维区域的选择。
  • 当α = 1和α = 2时,通过闭式雅可比矩阵(表示为广义协方差矩阵)实现了高效的反向传播。
  • 在文本分类任务中,连续注意力聚焦于有意义的句子片段,提升了可解释性且未牺牲准确性。
  • 在机器翻译任务中,连续注意力机制与离散softmax相比表现出具有竞争力的性能,且注意力图的定位更优。
  • 在视觉问题回答任务中,连续注意力能正确聚焦于相关图像区域(如连续区域内的物体计数),在需要空间一致性的任务中优于离散注意力。
  • 可视化示例(图4–7)表明,连续注意力避免了在多个无关区域之间分散注意力,从而在复杂计数和定位任务中实现了更准确的答案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。