[论文解读] Not All Attention Is All You Need
本文提出 AttendOut,一种动态丢弃方法,利用自注意力机制在预训练语言模型中生成样本特定、层特定的丢弃模式,显著提升了下游 NLP 任务的鲁棒性和性能。AttendOut 通过学习自适应注意力正则化,实现了 SOTA 结果,在多个基准测试中优于固定概率和静态丢弃方法。
Beyond the success story of pre-trained language models (PrLMs) in recent natural language processing, they are susceptible to over-fitting due to unusual large model size. To this end, dropout serves as a therapy. However, existing methods like random-based, knowledge-based and search-based dropout are more general but less effective onto self-attention based models, which are broadly chosen as the fundamental architecture of PrLMs. In this paper, we propose a novel dropout method named AttendOut to let self-attention empowered PrLMs capable of more robust task-specific tuning. We demonstrate that state-of-the-art models with elaborate training design may achieve much stronger results. We verify the universality of our approach on extensive natural language processing tasks.
研究动机与目标
- 为解决在数据量有限的情况下进行特定任务微调时,深层自注意力网络中的过拟合和共适应问题。
- 克服静态、基于随机性的丢弃方法在自注意力模型中的局限性,这些方法因固定概率和缺乏样本级自适应性而效果较差。
- 开发一种可学习的、端到端的丢弃机制,为每个样本和每层生成动态的、由注意力驱动的丢弃模式。
- 证明 AttendOut 在多样化 NLP 任务和模型架构中的通用性与有效性。
提出的方法
- AttendOut 引入了一个可学习的基于注意力的丢弃模块(G-Net),利用自注意力机制为每个注意力头和样本生成动态丢弃掩码。
- 该方法在训练过程中将这些学习到的掩码应用于注意力矩阵,通过样本特定、层特定的丢弃有效正则化注意力共适应。
- 丢弃模式生成过程是可微的,并通过反向传播端到端训练,使模型能够学习最优的注意力正则化模式。
- 引入了一种调度的伯努利丢弃基线,以近似 AttendOut 的动态模式,验证了所学习结构的有效性。
- 该方法被应用于 RoBERTa 等标准预训练模型,仅需极少的架构修改,且无额外推理成本。
- 该方法在多个 NLP 任务上进行了评估,包括文本分类和自然语言推理,使用标准基准测试。
实验结果
研究问题
- RQ1动态的、由注意力驱动的丢弃模式是否能提升基于自注意力的预训练语言模型在微调过程中的泛化能力和鲁棒性?
- RQ2与固定概率丢弃和层级正则化方法(如 LayerDrop)相比,AttendOut 在性能和稳定性方面表现如何?
- RQ3所学习的丢弃模式在多大程度上反映了任务特定和层特定的正则化需求,如通过训练动态可观察到的?
- RQ4对 AttendOut 模式进行调度的、基于随机的近似是否能实现相当的性能,从而表明所学习结构的有效性?
- RQ5AttendOut 在具有不同数据规模和复杂度的多样化 NLP 任务中是否具有普遍有效性?
主要发现
- 在 CoLA 基准上,AttendOut 相较于原始丢弃方法实现了 4.1% 的绝对性能提升,表明动态正则化带来了显著增益。
- 在 QNLI 上,AttendOut 将 RoBERTa 的准确率从 92.0 提升至 93.1,实现了 1.1 个百分点的增益,表明在各类任务中均具有一致的改进。
- 该方法优于 LayerDrop 和 Attn.LayerDrop,在 MNLI 上提升 1.0 个百分点,在 CoLA 上提升 1.7 个百分点,相较于 RoBERTa。
- 所学习的丢弃模式在低层表现出更高的概率,并具有动态适应性,尤其在 CoLA 中最高达 0.9,表明在小样本数据集上施加了更强的正则化。
- 调度的伯努利丢弃基线在 CoLA 上与 AttendOut 表现接近(提升 0.8 个百分点),验证了动态模式学习的正确性。
- 收敛曲线显示,AttendOut 实现了更快且更稳定的训练过程,性能在各训练周期中持续提升,而基线模型则趋于平台期或下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。