Skip to main content
QUICK REVIEW

[论文解读] Dataless Knowledge Fusion by Merging Weights of Language Models

Xisen Jin, Xiang Ren|arXiv (Cornell University)|Dec 19, 2022
Topic Modeling被引用 8
一句话总结

本文提出Regression Mean(RegMean),一种无需训练数据的模型融合方法,通过在参数空间中最小化预测差异,利用闭式解融合微调过的语言模型。该方法显著优于Fisher加权平均和模型集成等基线方法,在无需训练数据的情况下,实现了更优的域内与域外泛化性能。

ABSTRACT

Fine-tuning pre-trained language models has become the prevalent paradigm for building downstream NLP models. Oftentimes fine-tuned models are readily available but their training data is not, due to data privacy or intellectual property concerns. This creates a barrier to fusing knowledge across individual models to yield a better single model. In this paper, we study the problem of merging individual models built on different training data sets to obtain a single model that performs well both across all data set domains and can generalize on out-of-domain data. We propose a dataless knowledge fusion method that merges models in their parameter space, guided by weights that minimize prediction differences between the merged model and the individual models. Over a battery of evaluation settings, we show that the proposed method significantly outperforms baselines such as Fisher-weighted averaging or model ensembling. Further, we find that our method is a promising alternative to multi-task learning that can preserve or sometimes improve over the individual models without access to the training data. Finally, model merging is more efficient than training a multi-task model, thus making it applicable to a wider set of scenarios.

研究动机与目标

  • 解决在隐私或知识产权限制下无法获取训练数据时,融合多个微调语言模型知识的挑战。
  • 开发一种计算高效的参数空间模型融合方法,无需微调或访问原始数据。
  • 通过整合在多样化数据集上训练的模型,提升模型在域内任务上的表现与域外泛化能力。
  • 提供一种可扩展的多任务学习替代方案,在不依赖数据访问的前提下保持或提升性能。
  • 证明模型融合在现实世界NLP部署场景中作为知识融合实用解决方案的可行性与优势。

提出的方法

  • 提出一种新颖的模型融合算法Regression Mean(RegMean),受最优线性回归启发,通过最小化合并模型与各模型之间的ℓ²距离。
  • 将模型融合问题建模为模型参数上的加权最小二乘优化,获得闭式解,避免迭代训练。
  • 利用少量域内与域外样本估计Fisher信息矩阵,以提升融合性能。
  • 将该方法应用于融合多个架构相同且预训练权重一致的微调模型(如RoBERTa、T5、DeBERTa)。
  • 引入排列匹配技术对齐不同模型之间的参数权重,提升融合质量。
  • 在多种模型类型与数据分布下评估融合效率与参数效率。

实验结果

研究问题

  • RQ1在无训练数据条件下,参数空间中的模型融合是否能优于模型集成或简单平均?
  • RQ2与单个微调模型相比,所提出的RegMean方法在域外数据上的泛化能力是否更优?
  • RQ3在多样化的NLP任务与数据集上,RegMean与Fisher加权平均及其他融合基线方法相比,性能表现如何?
  • RQ4在存在私有或专有训练数据的场景中,无数据融合在多大程度上可作为多任务学习的实用替代方案?
  • RQ5使用少量域内样本估计Fisher信息对融合性能及数据泄露风险有何影响?

主要发现

  • RegMean在所有评估设置下(包括域内与域外泛化)均显著优于Fisher加权平均与模型集成。
  • 合并模型在域外数据上的表现优于表现最佳的单个模型,展现出强大的泛化能力。
  • RegMean保持了较高的推理速度,并仅增加极少的参数开销,因此比从零开始训练多任务模型更高效。
  • 即使在仅使用少量域内样本(如10–50个)估计Fisher信息时,该方法仍表现稳健,显著降低了对数据的依赖。
  • 通过RegMean进行模型融合在多种架构(如RoBERTa、T5、DeBERTa)与任务上均保持或提升了性能,表明其具有广泛的适用性。
  • 该方法可在不共享数据的前提下,实现基于私有数据训练的模型之间的知识融合,为数据受限环境提供了多任务学习的可行替代方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。