[论文解读] On the Importance of Attention in Meta-Learning for Few-Shot Text Classification
该论文提出ATAML,一种用于少样本文本分类的元学习框架,通过将任务无关表征学习与任务特定注意力适配分离,实现更优的泛化性能。在miniRCV1和miniReuters-21578数据集上,ATAML通过在快速适应过程中利用注意力机制聚焦于相关文本子结构,显著优于随机初始化、预训练模型及标准MAML模型。
Current deep learning based text classification methods are limited by their ability to achieve fast learning and generalization when the data is scarce. We address this problem by integrating a meta-learning procedure that uses the knowledge learned across many tasks as an inductive bias towards better natural language understanding. Based on the Model-Agnostic Meta-Learning framework (MAML), we introduce the Attentive Task-Agnostic Meta-Learning (ATAML) algorithm for text classification. The essential difference between MAML and ATAML is in the separation of task-agnostic representation learning and task-specific attentive adaptation. The proposed ATAML is designed to encourage task-agnostic representation learning by way of task-agnostic parameterization and facilitate task-specific adaptation via attention mechanisms. We provide evidence to show that the attention mechanism in ATAML has a synergistic effect on learning performance. In comparisons with models trained from random initialization, pretrained models and meta trained MAML, our proposed ATAML method generalizes better on single-label and multi-label classification tasks in miniRCV1 and miniReuters-21578 datasets.
研究动机与目标
- 为解决深度学习模型在数据稀缺和泛化能力差的少样本文本分类挑战提供方案。
- 探究注意力机制如何通过实现任务特定适应来增强元学习在文本分类中的表现。
- 开发一种将共享表征学习与任务特定适配解耦的元学习框架,以提升样本效率。
- 证明注意力机制在少样本文本分类中不仅提升性能,更在实现泛化方面起到关键作用。
提出的方法
- 提出ATAML,一种元学习算法,将元学习器(任务无关表征学习)与基学习器(任务特定注意力适配)分离。
- 使用元学习器通过卷积或循环网络学习共享的、任务无关的表征,其参数由元优化过程初始化。
- 在基学习器中引入注意力机制,以在新任务的快速适应过程中动态加权词或短语表征。
- 采用两步优化策略:首先,元学习器更新共享参数以支持快速适应;其次,基学习器使用少量样本为每个任务微调注意力权重。
- 引入miniRCV1和miniReuters-21578作为专为少样本文本分类设计的基准数据集。
- 采用空洞卷积网络(TCN)作为骨干网络,以更有效地捕捉文本中的长距离依赖关系。
实验结果
研究问题
- RQ1将任务无关表征学习与任务特定注意力适配分离,是否能提升少样本文本分类性能?
- RQ2注意力机制在元学习用于文本分类时,如何促进泛化?
- RQ3注意力机制能否帮助减少在低资源环境下对词级伪相关性的过拟合?
- RQ4ATAML在少样本文本分类中与MAML、随机初始化及预训练模型相比表现如何?
- RQ5哪些架构选择(如TCN与LSTM)最能支持文本分类中的元学习?
主要发现
- 在miniRCV1和miniReuters-21578数据集上,ATAML在性能上显著优于随机初始化、微调预训练模型及标准MAML模型。
- ATAML中的注意力机制使模型能够聚焦于相关短语,如“accept regulation of”和“recommendation that”,而非无关词如“tobacco”或“drug”。
- 使用TCN作为基学习器的模型泛化能力更强且训练速度更快,而使用LSTM的模型常在元训练早期出现饱和。
- 消融实验表明,即使在元训练过程中不更新注意力参数,性能依然强劲,表明注意力机制的作用在于促进共享表征学习。
- 可视化结果证实,ATAML学习到更具语义意义的注意力模式,有效减少了对词级噪声的过拟合。
- 空洞卷积的使用通过有效捕捉长距离依赖关系,显著提升了少样本设置下的表征学习能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。