Skip to main content
QUICK REVIEW

[论文解读] Linear Connectivity Reveals Generalization Strategies

Jeevesh Juneja, Rachit Bansal|arXiv (Cornell University)|May 24, 2022
Topic Modeling被引用 7
一句话总结

该论文揭示,在NLP文本分类任务中,微调后的模型会占据不同的、不连通的损失曲面基域——通过线性模式连通性(LMC)揭示——这些基域对应于不同的泛化策略,例如词汇重叠或句法启发式。与图像分类不同,迁移学习并不能保证线性连通性,且基域归属可预测模型在分布外诊断数据集上的性能。

ABSTRACT

It is widely accepted in the mode connectivity literature that when two neural networks are trained similarly on the same data, they are connected by a path through parameter space over which test set accuracy is maintained. Under some circumstances, including transfer learning from pretrained models, these paths are presumed to be linear. In contrast to existing results, we find that among text classifiers (trained on MNLI, QQP, and CoLA), some pairs of finetuned models have large barriers of increasing loss on the linear paths between them. On each task, we find distinct clusters of models which are linearly connected on the test loss surface, but are disconnected from models outside the cluster -- models that occupy separate basins on the surface. By measuring performance on specially-crafted diagnostic datasets, we find that these clusters correspond to different generalization strategies: one cluster behaves like a bag of words model under domain shift, while another cluster uses syntactic heuristics. Our work demonstrates how the geometry of the loss surface can guide models towards different heuristic functions.

研究动机与目标

  • 调查在线性模式连通性(LMC)是否在微调的NLP模型中成立,挑战计算机视觉中的假设。
  • 确定在文本分类任务中是否存在不同的损失曲面基域,以及它们是否与模型行为的功能差异相关。
  • 将基域归属与在分布外(OOD)诊断数据集上的实际泛化性能联系起来。
  • 探索训练动态和初始化如何影响基域选择及模型泛化策略。
  • 评估替代微调方法(如线性探测后全量微调,LP-FT)是否能减少基域多样性并提高泛化一致性。

提出的方法

  • 通过凸性差距(CG)度量线性模式连通性(LMC),CG定义为模型权重向量之间线性插值路径上的最大损失。
  • 在CG矩阵的谱空间上使用k-means聚类,以识别权重空间中不同的吸引盆。
  • 使用不同的随机种子在MNLI、QQP和CoLA上训练多个基于BERT和RoBERTa的模型,以改变数据顺序和头初始化。
  • 在诊断数据集(如HANS-LO、PAWS-QQP)上评估模型,以评估在分布偏移下的泛化行为。
  • 比较LMC与欧几里得距离度量,以确定几何接近性是否与基域归属相关。
  • 应用LP-FT(线性探测后全量微调)以评估其对基域多样性与模型同质性的影响。

实验结果

研究问题

  • RQ1在文本分类任务中,微调后的NLP模型是否像在图像分类中那样,在不同训练运行间表现出线性连通性?
  • RQ2文本分类器的损失曲面中是否存在多个不连通的基域,且它们是否对应于不同的泛化策略?
  • RQ3能否通过LMC几何结构预测的基域归属与在分布外诊断数据集上的性能相关联?
  • RQ4训练过程(如LP-FT与标准微调)如何影响基域多样性与模型泛化行为?
  • RQ5欧几里得距离与凸性差距在多大程度上与基域归属及模型功能差异相关?

主要发现

  • 在MNLI、QQP和CoLA等NLP任务中,微调后的模型经常占据不同的、不连通的损失曲面基域,这与计算机视觉中的假设相矛盾。
  • 同一基域内的模型在诊断数据集(如HANS-LO)上表现出相似的性能,而不同基域的模型则显示出截然不同的泛化行为。
  • 在MNLI上,一个聚类在领域偏移下表现得像词袋模型,而另一个则使用句法启发式,表明其具有不同的功能策略。
  • 凸性差距(CG)度量能有效识别基域归属,在BERT模型中观察到明显的聚类,但在RoBERTa模型中则不然。
  • LP-FT减少了基域多样性与凸性差距的方差,使模型更加同质化,功能差异更小。
  • 欧几里得距离在基域内部比在基域之间与CG的相关性更强,表明基域归属决定了权重空间中的几何接近性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。