[论文解读] IsoBN: Fine-Tuning BERT with Isotropic Batch Normalization
本文提出了一种新型正则化方法——各向同性批量归一化(IsoBN),通过动态惩罚主导主成分,使[BERT]和[RoBERTa]微调时的[CLS]嵌入更加各向同性,从而提升性能。与忽略相关性的标准批量归一化不同,IsoBN将相关性建模为分块对角结构,使七项GLUE任务的F1/Spearman分数平均提升约1.0分,优于标准批量归一化。
Fine-tuning pre-trained language models (PTLMs), such as BERT and its better variant RoBERTa, has been a common practice for advancing performance in natural language understanding (NLU) tasks. Recent advance in representation learning shows that isotropic (i.e., unit-variance and uncorrelated) embeddings can significantly improve performance on downstream tasks with faster convergence and better generalization. The isotropy of the pre-trained embeddings in PTLMs, however, is relatively under-explored. In this paper, we analyze the isotropy of the pre-trained [CLS] embeddings of PTLMs with straightforward visualization, and point out two major issues: high variance in their standard deviation, and high correlation between different dimensions. We also propose a new network regularization method, isotropic batch normalization (IsoBN) to address the issues, towards learning more isotropic representations in fine-tuning by dynamically penalizing dominating principal components. This simple yet effective fine-tuning method yields about 1.0 absolute increment on the average of seven NLU tasks.
研究动机与目标
- 研究[BERT]和[RoBERTa]中预训练[CLS]嵌入的各向同性,特别是其方差和维度间相关性结构。
- 识别出标准差的高方差以及维度间强相关性会阻碍微调性能。
- 开发一种实用的正则化方法,在不增加高计算成本的前提下,改善微调过程中的各向同性。
- 证明减少前几大主成分的主导性可加快下游自然语言理解任务的收敛速度并提升泛化能力。
提出的方法
- 提出各向同性批量归一化(IsoBN),通过同时使用标准差和成对相关系数对[CLS]嵌入进行归一化。
- 将绝对相关系数矩阵建模为分块对角结构,假设存在高度相关的维度组,而非像标准批量归一化那样假设为对角矩阵。
- 通过惩罚高方差和高度相关的维度,对主导主成分实施动态缩放以抑制其贡献。
- 将IsoBN集成到[BERT]和[RoBERTa]的微调流程中,替换标准批量归一化层。
- 使用解释方差(EV_k)定量衡量各向同性改进程度,比较归一化前、标准批量归一化和IsoBN的效果。
- 使用半精度训练模型,并在GLUE基准任务上进行评估,以确保兼容性和效率。
实验结果
研究问题
- RQ1在方差和维度间相关性方面,[BERT]和[RoBERTa]中预训练的[CLS]嵌入有多各向同性?
- RQ2[CLS]嵌入中主导主成分在多大程度上限制了微调性能?
- RQ3一种考虑维度间相关性的改进型批量归一化方法,能否提升各向同性和下游性能?
- RQ4IsoBN是否在减少前几大主成分的解释方差方面优于标准批量归一化?
主要发现
- [BERT]和[RoBERTa]中预训练的[CLS]嵌入表现出较高的标准差方差和显著的维度间相关性,表明其各向同性较差。
- 前三个主成分平均解释了约86%的方差,部分数据集(如[STS-B])甚至超过90%。
- 标准批量归一化仅将解释方差(EV₃)减少0.025([BERT])和0.148([RoBERTa]),原因是忽略了相关性。
- IsoBN将EV₃降低至0.123([BERT])和0.425([RoBERTa]),与标准批量归一化相比显著提升了各向同性。
- IsoBN在七项GLUE基准任务上实现了平均1.0分的F1/Spearman分数绝对提升。
- 该方法稳定、高效,且与半精度训练兼容,适用于实际微调场景。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。