[论文解读] TaCL: Improving BERT Pre-training with Token-aware Contrastive Learning
本文提出 TaCL,一种新颖的持续预训练方法,通过基于标记的对比学习改进 BERT 的标记表征。通过将学生模型中掩码标记的表征与冻结教师模型的参考表征进行对比,TaCL 学习到更具各向同性与判别性的标记嵌入,从而在无需额外数据的情况下,于多种英文和中文 NLU 基准测试中实现一致的性能提升。
Masked language models (MLMs) such as BERT and RoBERTa have revolutionized the field of Natural Language Understanding in the past few years. However, existing pre-trained MLMs often output an anisotropic distribution of token representations that occupies a narrow subset of the entire representation space. Such token representations are not ideal, especially for tasks that demand discriminative semantic meanings of distinct tokens. In this work, we propose TaCL (Token-aware Contrastive Learning), a novel continual pre-training approach that encourages BERT to learn an isotropic and discriminative distribution of token representations. TaCL is fully unsupervised and requires no additional data. We extensively test our approach on a wide range of English and Chinese benchmarks. The results show that TaCL brings consistent and notable improvements over the original BERT model. Furthermore, we conduct detailed analysis to reveal the merits and inner-workings of our approach.
研究动机与目标
- 为解决预训练 BERT 模型中标记表征的各向异性分布问题,该问题限制了其判别能力。
- 提升通用性标记级表征质量,以支持 NLU 任务中的迁移学习。
- 开发一种完全无监督的持续预训练方法,以增强标记级别的表征多样性与判别性。
- 证明在下游 NLU 任务中,标记级对比学习相较于现有句子级对比方法具有更大优势。
- 提供对所提方法内部机制及其对表征空间几何结构影响的实证与消融分析。
提出的方法
- 学生模型从预训练 BERT 初始化,并通过三种目标持续微调:掩码语言建模(MLM)、下一句预测(NSP)和一种新型 TaCL 对比损失。
- 冻结的教师模型处理原始未掩码输入序列,为每个标记生成参考表征。
- TaCL 损失将学生模型对掩码标记的表征(正样本)与同一序列中其他标记的表征(负样本)进行对比,使用余弦相似度。
- 对比目标定义为:$\mathcal{L}_{\textup{TaCL}} = -\sum_{i=1}^{n}\mathds{1}(\tilde{x}_{i})\log\frac{\exp(\textup{sim}(\tilde{h}_{i},h_{i})/\tau)}{\sum_{j=1}^{n}\exp(\textup{sim}(\tilde{h}_{i},h_{j})/\tau)}$,其中 $\mathds{1}(\tilde{x}_{i})$ 在标记 $i$ 被掩码时为 1。
- 总体损失结合 TaCL、MLM 和 NSP:$\mathcal{L} = \mathcal{L}_{\textup{TaCL}} + \mathcal{L}_{\textup{MLM}} + \mathcal{L}_{\textup{NSP}}$。
- 该方法完全无监督,仅使用原始预训练语料,无需额外数据。
实验结果
研究问题
- RQ1在标记级别进行对比学习是否能提升 BERT 表征的判别质量?
- RQ2学习各向同性标记表征是否能带来在多样化 NLU 基准测试中的更好性能?
- RQ3在下游迁移性能方面,TaCL 与当前最先进的句子级对比学习方法相比如何?
- RQ4TaCL 对学习到的表征空间几何结构有何影响?
- RQ5所提方法是否能在英文与低资源中文 NLU 任务中均提升性能?
主要发现
- TaCL 在涵盖 GLUE、SQuAD 1.1、SQuAD 2.0 以及多种 NER 和 CWS 任务的广泛英文与中文 NLU 基准测试中,均实现一致且显著的性能提升。
- 在 GLUE 基准测试中,TaCL 将 BERT-base 的平均得分从 85.4 提升至 86.7,9 项任务中有 7 项取得提升,包括 CoLA 上提升 2.1 分,SST-2 上提升 1.3 分。
- 在 SQuAD 1.1 上,TaCL 将 BERT-base 的 F1 从 91.8 提升至 92.6,EM 从 88.5 提升至 89.2,表明在抽取式问答任务中取得显著增益。
- 在中文 NER 任务中,TaCL 相较于 BERT-base 在 Ontonotes 上实现 2.1 分的 F1 提升,在 Resume 上实现 1.8 分的增益。
- 自相似性矩阵可视化结果表明,与 BERT 相比,TaCL 生成的标记表征更具各向同性与判别性,且不同标记之间的分离更清晰。
- 消融研究显示,TaCL 损失是性能提升的主要驱动力,且在标记级下游任务中,该方法优于句子级对比学习。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。