[论文解读] Mask Attention Networks: Rethinking and Strengthen Transformer
本文提出动态掩码注意力网络(DMAN),一种新颖的注意力机制,通过学习自适应、上下文相关的掩码来增强Transformer模型的局部结构建模能力。通过将自注意力网络(SAN)和前馈网络(FFN)统一为使用静态掩码的掩码注意力网络(MAN)的特例,作者提出了具有可学习、动态掩码的DMAN,以增强对邻近标记的关注,通过DMAN → SAN → FFN的序列架构,在神经机器翻译和文本摘要任务中实现了最先进性能。
Transformer is an attention-based neural network, which consists of two sublayers, namely, Self-Attention Network (SAN) and Feed-Forward Network (FFN). Existing research explores to enhance the two sublayers separately to improve the capability of Transformer for text representation. In this paper, we present a novel understanding of SAN and FFN as Mask Attention Networks (MANs) and show that they are two special cases of MANs with static mask matrices. However, their static mask matrices limit the capability for localness modeling in text representation learning. We therefore introduce a new layer named dynamic mask attention network (DMAN) with a learnable mask matrix which is able to model localness adaptively. To incorporate advantages of DMAN, SAN, and FFN, we propose a sequential layered structure to combine the three types of layers. Extensive experiments on various tasks, including neural machine translation and text summarization demonstrate that our model outperforms the original Transformer.
研究动机与目标
- 将自注意力网络(SAN)和前馈网络(FFN)统一为具有静态掩码的统一掩码注意力网络(MAN)框架的特例。
- 识别SAN和FFN中静态掩码在建模文本表示中局部依赖关系方面的局限性。
- 提出一种具有上下文与距离相关可学习掩码的动态掩码注意力网络(DMAN),以更好地捕捉局部结构。
- 设计一种新的序列架构DMAN → SAN → FFN,以协同结合DMAN、SAN和FFN的优势。
- 在神经机器翻译和生成式文本摘要任务上对所提模型进行实证验证。
提出的方法
- 将SAN和FFN重新表述为掩码注意力网络(MAN),其中注意力计算为键-查询注意力矩阵与掩码矩阵的逐元素乘积。
- 将SAN的掩码矩阵定义为全1矩阵,FFN的掩码矩阵定义为单位矩阵,从而确立其作为MAN的特例。
- 提出DMAN,其具有可学习的掩码矩阵,能根据查询上下文和相对标记距离动态调整,以突出邻近标记。
- 设计序列架构:DMAN → SAN → FFN,其中DMAN在SAN捕获长距离依赖之前增强局部上下文建模,FFN执行非线性变换。
- 使用标准Transformer目标端到端训练模型,利用动态掩码使模型更强烈地关注窗口化上下文中的邻近标记。
- 在窗口大小$w$内计算注意力得分贡献,使用$attn\_s_{w,l,*}$作为量化局部注意力有效性的指标。
实验结果
研究问题
- RQ1如何系统性地将自注意力网络(SAN)和前馈网络(FFN)统一于一个共同框架下?
- RQ2为何SAN和FFN中的静态掩码矩阵限制了其在文本表示中建模局部依赖关系的能力?
- RQ3可学习的动态掩码机制是否能在不牺牲全局建模能力的前提下提升Transformer中的局部结构建模能力?
- RQ4DMAN、SAN和FFN的最佳架构组合方式是什么,以在NLP任务中最大化性能?
- RQ5与标准自注意力机制相比,所提出的DMAN机制在多大程度上增强了对邻近标记的注意力?
主要发现
- 在IWSLT14 De-En测试集第1层中,窗口大小为2的DMAN对邻近标记的注意力得分贡献比SAN高出50%,在某些情况下差距可达五倍。
- 在窗口大小为4时,DMAN在第1层的注意力得分贡献达到95.09%,而SAN仅为30.38%,表明其在局部注意力建模方面具有显著优势。
- 所提出的DMAN → SAN → FFN架构在神经机器翻译和生成式文本摘要任务上均优于原始Transformer模型。
- DMAN中的动态掩码有效降低了来自非邻近、间接相关标记的噪声,通过抑制其注意力得分实现。
- 注意力得分分析表明,DMAN对局部窗口内标记的注意力显著高于SAN,尤其在早期层中,此时局部模式至关重要。
- 模型性能的提升归因于DMAN自适应强调局部上下文的能力,同时保留了SAN的全局建模能力和FFN的非线性变换能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。