[论文解读] Multi-Scale Self-Attention for Text Classification
本文提出多尺度自注意力(MSMSA),一种新颖的多头注意力机制,通过为各个注意力头分配可变的感受野(尺度),注入归纳偏置以提升泛化能力。通过在浅层使用小尺度头、在深层平衡各尺度,多尺度Transformer在21个数据集上持续且显著地优于标准Transformer,尤其在小到中等规模基准上表现突出。
In this paper, we introduce the prior knowledge, multi-scale structure, into self-attention modules. We propose a Multi-Scale Transformer which uses multi-scale multi-head self-attention to capture features from different scales. Based on the linguistic perspective and the analysis of pre-trained Transformer (BERT) on a huge corpus, we further design a strategy to control the scale distribution for each layer. Results of three different kinds of tasks (21 datasets) show our Multi-Scale Transformer outperforms the standard Transformer consistently and significantly on small and moderate size datasets.
研究动机与目标
- 解决标准自注意力机制在小规模和中等规模文本分类数据集上因缺乏归纳偏置而导致的泛化能力差的问题。
- 将多尺度归纳偏置引入自注意力机制,以改善特征学习和模型鲁棒性。
- 设计一种受语言层次结构启发的层间尺度分布策略,偏好在浅层使用局部(小尺度)头,在深层使用平衡尺度。
- 证明多尺度注意力在不替换标准Transformer架构或增加额外组件的前提下,可提升性能。
提出的方法
- 提出多尺度多头自注意力(MSMSA),其中每个注意力头在其可变大小的感受野(尺度)上运行,限制注意力计算的上下文窗口。
- 将头的尺度定义为它所关注的标记数量,较小的尺度强调局部模式,较大的尺度捕捉全局上下文。
- 引入一种由超参数 α 控制的可学习尺度分布策略,用于调节各层间的尺度分布:α 越高,浅层中的局部偏置越强。
- 通过堆叠 MSMSA 层构建多尺度Transformer,用多尺度注意力机制替代标准多头注意力和前馈网络。
- 采用五种候选尺度的尺度选择策略:1、3、N/16、N/8、N/4,其中 N 为序列长度。
- 使用标准优化方法(Adam、Dropout、权重衰减)在文本分类任务上训练模型,所有实验采用固定超参数。
实验结果
研究问题
- RQ1在小规模和中等规模文本分类数据集中,向自注意力机制中注入多尺度归纳偏置是否能改善泛化能力?
- RQ2在文本分类中,多尺度自注意力的最优层间尺度分布策略是什么?
- RQ3当参数量和层数保持不变时,多尺度注意力是否优于单尺度注意力机制?
- RQ4与全局或非平衡分布相比,选择特定尺度分布(如浅层中的局部偏置)如何影响模型性能?
- RQ5所提方法是否能在不进行架构大改或增加额外组件的前提下实现最先进性能?
主要发现
- 多尺度Transformer在所有21个测试数据集中均优于标准Transformer,尤其在小规模和中等规模数据集上表现出持续且显著的性能提升。
- 使用正值 α(偏好浅层中的局部偏置)可获得最佳性能,在SNLI数据集上达到85.9%准确率,而最差 α 值仅达84.3%。
- 采用平衡尺度分布(α = 0.5)的模型在SNLI上达到85.9%准确率,优于所有单尺度模型(最高仅84.3%)。
- 固定尺度的单尺度模型(如N/4)表现显著较差,准确率降至80.7%,表明固定尺度注意力缺乏灵活性。
- α = 1.0(浅层中强局部偏置)的模型在SNLI上达到85.5%准确率,表明局部归纳偏置对性能至关重要。
- 即使在中等规模训练数据(如SNLI中55万样本)下,多尺度Transformer仍优于标准Transformer,表明通过尺度偏置引入先验知识可降低对数据量的依赖。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。