[论文解读] Unsupervised Transfer Learning via BERT Neuron Selection
本文提出了一种新颖的无监督迁移学习方法,通过在 BERT 中选择特定任务的神经元来提升 NLP 分类任务的性能,而无需微调整个模型。通过识别并选择情感分析、自然语言蕴含和句子相似性任务中所有层中最关键的神经元,该方法仅使用数百个可解释的神经元即实现了最先进(SOTA)的性能表现,显著优于 BERT 的最后一层表示,并表明迁移能力与特定任务神经元指纹的相似性密切相关。
Recent advancements in language representation models such as BERT have led to a rapid improvement in numerous natural language processing tasks. However, language models usually consist of a few hundred million trainable parameters with embedding space distributed across multiple layers, thus making them challenging to be fine-tuned for a specific task or to be transferred to a new domain. To determine whether there are task-specific neurons that can be exploited for unsupervised transfer learning, we introduce a method for selecting the most important neurons to solve a specific classification task. This algorithm is further extended to multi-source transfer learning by computing the importance of neurons for several single-source transfer learning scenarios between different subsets of data sources. Besides, a task-specific fingerprint for each data source is obtained based on the percentage of the selected neurons in each layer. We perform extensive experiments in unsupervised transfer learning for sentiment analysis, natural language inference and sentence similarity, and compare our results with the existing literature and baselines. Significantly, we found that the source and target data sources with higher degrees of similarity between their task-specific fingerprints demonstrate a better transferability property. We conclude that our method can lead to better performance using just a few hundred task-specific and interpretable neurons.
研究动机与目标
- 为解决在不进行完整微调的情况下,将大型预训练语言模型迁移至低资源领域的问题。
- 识别 BERT 中可在不同领域间泛化的特定任务神经元,以支持无监督迁移学习。
- 开发一种可扩展且可解释的方法,仅从 BERT 所有层中选择最相关的神经元。
- 证明特定任务神经元指纹的相似性可预测不同数据源之间的迁移能力。
- 在不修改模型架构或使用目标数据标签的情况下,超越现有基线方法在无监督迁移学习中对情感分析、自然语言蕴含和句子相似性任务的表现。
提出的方法
- 提出 SingleTSNS:一种单源神经元选择算法,通过随机采样与累积以增强稳定性,在 BERT 所有层中为神经元分配重要性分数。
- 扩展为 MultiTSNS:一种多源方法,为每对不相交的数据子集分别训练一个神经元重要性学习器,再通过元聚合器整合结果,计算元重要性分数。
- 应用特征选择方法,仅保留来自元重要性分数的最关键神经元,将模型规模缩减至仅数百个神经元。
- 引入特定任务指纹:每层被选中神经元的占比,作为数据源语言特征的紧凑、可解释的表示。
- 采用水填算法,在多源迁移学习中公平地在多个源之间分配有限的源数据样本。
- 使用元聚合器融合来自多个源对的重要性度量,实现对多样化数据源的有效融合,从而提升泛化能力。
实验结果
研究问题
- RQ1仅从 BERT 全层堆栈中选取一小部分特定任务神经元,是否能在无监督迁移学习中表现优于使用完整最后一层表示?
- RQ2源域与目标域特定任务神经元指纹之间的相似性,是否能预测零样本迁移学习中的迁移能力?
- RQ3通过神经元选择实现的多源迁移学习是否能超越单源方法,尤其是在整合多样化数据源时?
- RQ4所提出的神经元选择方法是否在情感分析、自然语言蕴含和句子相似性等多样化 NLP 任务中均具备可解释性与有效性?
- RQ5该方法是否能在不微调 BERT 架构或使用目标数据标签的情况下,实现最先进性能?
主要发现
- 在情感分析任务中,MultiTSNS 在仅使用 500 个神经元的情况下,平均性能比 BERT 最后一层表示高出 3.0%,超越当前最先进水平。
- 在 SciTail 自然语言蕴含基准上,MultiTSNS 在不同源组合下相较 BERT 基线性能提升 3.8% 至 13.0%,相比 SingleTSNS 最高提升达 9.5%。
- 该方法在 QQP 和 SciTail 数据集上实现了此前未报告的无监督迁移学习任务的显著性能提升,展现出广泛适用性。
- 迁移性能与指纹相似性高度相关:源与目标数据源的特定任务神经元指纹越相似,迁移效果越好。
- 特定任务指纹——即各层被选中神经元的占比——为数据源语言特征提供了紧凑、可解释且具有预测能力的表示。
- 仅使用 MultiTSNS 选择的 500 个神经元,性能已优于使用 BERT 最后一层的 1024 个神经元,表明完整模型微调并非实现高性能的必要条件。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。