[论文解读] BERT's output layer recognizes all hidden layers? Some Intriguing Phenomena and a simple way to boost BERT
该论文发现,尽管从未在这些表示上进行过训练,BERT的输出层仍能从任意层的隐藏表示中重建输入标记——这揭示了各层之间惊人的表征相似性。通过简单地复制预训练BERT模型中的层(无需微调),该方法在SQuAD 2.0和SNLI等下游NLP任务上实现了性能提升,F1分数最高提升1.5分,准确率提升0.6%,且使用与基线模型相同的超参数。
Although Bidirectional Encoder Representations from Transformers (BERT) have achieved tremendous success in many natural language processing (NLP) tasks, it remains a black box. A variety of previous works have tried to lift the veil of BERT and understand each layer's functionality. In this paper, we found that surprisingly the output layer of BERT can reconstruct the input sentence by directly taking each layer of BERT as input, even though the output layer has never seen the input other than the final hidden layer. This fact remains true across a wide variety of BERT-based models, even when some layers are duplicated. Based on this observation, we propose a quite simple method to boost the performance of BERT. By duplicating some layers in the BERT-based models to make it deeper (no extra training required in this step), they obtain better performance in the downstream tasks after fine-tuning.
研究动机与目标
- 探究BERT的输出层是否能在未针对其进行训练的情况下,从中间层的隐藏状态中重建输入序列。
- 通过使用预训练的输出头探测,探索BERT隐藏层之间的表征相似性。
- 开发并评估一种简单、无需训练的方法,通过层复制增加模型深度,以提升基于BERT的模型性能。
- 评估这种深度增强是否能提升下游NLP任务(如文本分类、自然语言推理和问答)的性能。
- 考察层复制对集成方法和模型泛化能力的影响。
提出的方法
- 使用预训练的BERT输出层(MLM头)作为解码器,从每一层的隐藏表示中重建输入标记序列,且无需任何额外训练。
- 通过将每层的输出馈送到输出层,评估重建序列的词级别准确率。
- 通过插入现有层的副本(例如,将BERT-base的前三个层复制)来实现层复制,以增加模型深度,且不共享权重。
- 使用与基线模型相同的超参数,在下游任务上对更深层的模型进行微调,从而实现直接的性能比较。
- 通过将多个具有不同复制层配置的模型的输出概率相加,构建集成模型以进一步提升性能。
- 在SST-2、SNLI和SQuAD 2.0数据集上,对BERT-base、ALBERT-base、ALBERT-large、ALBERT-xlarge和ALBERT-xxlarge进行实验。
实验结果
研究问题
- RQ1BERT的输出层是否能在未针对其进行训练的情况下,从任意中间层的隐藏表示中重建原始输入序列?
- RQ2不同BERT层的隐藏表示是否具有足够相似的分布,可被同一输出层解码?
- RQ3在不进行微调或超参数调优的情况下,复制预训练BERT模型中的层是否能提升下游性能?
- RQ4层复制带来的性能增益是否在不同BERT变体和NLP任务上保持一致?
- RQ5层复制技巧是否能提升在SQuAD 2.0等挑战性基准上的集成模型性能?
主要发现
- BERT的输出层即使仅在最后一层的表示上进行过训练,也能以高词级别准确率从所有层的隐藏状态中重建输入序列。
- 该重建能力在多个BERT变体(包括ALBERT)中均成立,表明层间具有强大的表征相似性。
- 在预训练BERT模型中复制层可一致提升SQuAD 2.0和SNLI的性能,分别带来1.5 F1分数提升和0.6%准确率增益。
- 性能提升无需任何额外训练或超参数调优,仅使用与基线模型相同的设置即可实现。
- 结合多个不同复制层配置的模型所构建的集成模型在SQuAD 2.0上实现了进一步性能提升,最佳集成模型达到85.50 EM和88.59 F1。
- 该方法在SST-2上未见提升,可能是因为该任务本身简单且基线性能已很高,导致改进空间有限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。