Skip to main content
QUICK REVIEW

[论文解读] Visualizing and Understanding the Effectiveness of BERT

Yaru Hao, Li Dong|arXiv (Cornell University)|Aug 15, 2019
Topic Modeling参考文献 31被引用 22
一句话总结

本文通过可视化 BERT 微调的损失景观和优化轨迹,解释了预训练为何能提升性能与泛化能力。结果表明,预训练提供了更优的初始点,导致更宽、更平的极小值点,并实现更快收敛,同时较低层在不同任务间表现出更强的不变性与可迁移性。

ABSTRACT

Language model pre-training, such as BERT, has achieved remarkable results in many NLP tasks. However, it is unclear why the pre-training-then-fine-tuning paradigm can improve performance and generalization capability across different tasks. In this paper, we propose to visualize loss landscapes and optimization trajectories of fine-tuning BERT on specific datasets. First, we find that pre-training reaches a good initial point across downstream tasks, which leads to wider optima and easier optimization compared with training from scratch. We also demonstrate that the fine-tuning procedure is robust to overfitting, even though BERT is highly over-parameterized for downstream tasks. Second, the visualization results indicate that fine-tuning BERT tends to generalize better because of the flat and wide optima, and the consistency between the training loss surface and the generalization error surface. Third, the lower layers of BERT are more invariant during fine-tuning, which suggests that the layers that are close to input learn more transferable representations of language.

研究动机与目标

  • 理解预训练-微调范式为何能提升 BERT 在各类 NLP 任务中的性能。
  • 研究微调 BERT 的优化动力学与泛化行为,相较于从随机初始化训练的对比。
  • 考察 BERT 各层在迁移学习与泛化中的作用。
  • 探索损失景观的几何特性,以解释 BERT 微调的鲁棒性与有效性。

提出的方法

  • 通过在预训练 BERT 参数与微调后参数之间进行线性插值,构建一维(1D)损失曲线。
  • 通过将高维参数空间投影到由优化轨迹导出的两个主方向上,生成二维(2D)损失曲面。
  • 通过将 SGD 更新的实际路径投影到 2D 损失曲面上,可视化优化轨迹。
  • 使用相同的可视化技术,对比从预训练权重微调与从随机初始化训练的结果。
  • 通过逐层消融实验,微调过程中选择性地冻结或“回退”特定层,以评估其对泛化能力的贡献。
  • 利用训练损失曲面与泛化误差曲面之间的相关性,评估模型的鲁棒性及极小值的平坦度。

实验结果

研究问题

  • RQ1预训练是否提供了更优的初始化点,从而在 BERT 微调中实现更快收敛与更易优化?
  • RQ2损失景观的几何特性——尤其是平坦度与宽度——如何与微调 BERT 的泛化性能相关联?
  • RQ3相较于高层,BERT 的低层在不同下游任务间是否表现出更强的不变性与可迁移性?
  • RQ4训练损失曲面与泛化误差曲面之间的一致性,如何解释 BERT 对过拟合的鲁棒性?
  • RQ5微调单个层对模型泛化能力有何影响?哪些层对可迁移性贡献最大?

主要发现

  • 与随机初始化相比,预训练提供了更优的初始化点,使 2D 损失景观上出现更宽、更平的极小值点。
  • 由于预训练损失景观的有利几何特性,微调 BERT 即使在高模型容量下也能实现更快收敛并更具抗过拟合能力。
  • 训练损失曲面与泛化误差曲面之间存在强相关性,表明微调过程中找到的平坦极小值能很好地泛化到未见数据。
  • BERT 的低层(第 0–7 层)在不同下游任务中表现出更强的不变性,表明其学习到更可迁移、与任务无关的语言表征。
  • 在 MNLI 数据集上,微调过程中回退低层可提升泛化性能,而回退高层则导致性能下降,证实了高层在学习任务特定特征中的作用。
  • 微调过程中的优化轨迹始终朝向更平坦、更宽的极小值移动,支持了预训练通过有利的损失几何特性实现更好泛化的假设。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。