[论文解读] lo-fi: distributed fine-tuning without communication
本文提出 lo-fi,一种在训练过程中节点间无需任何通信的大型神经网络分布式微调方法。每个节点独立微调其模型,最终模型通过训练后对权重进行平均得到;lo-fi 在 ImageNet 和分布偏移基准测试中达到或超过基线准确率,同时消除了通信开销。
When fine-tuning large neural networks, it is common to use multiple nodes and to communicate gradients at each optimization step. By contrast, we investigate completely local fine-tuning, which we refer to as lo-fi. During lo-fi, each node is fine-tuned independently without any communication. Then, the weights are averaged across nodes at the conclusion of fine-tuning. When fine-tuning DeiT-base and DeiT-large on ImageNet, this procedure matches accuracy in-distribution and improves accuracy under distribution shift compared to the baseline, which observes the same amount of data but communicates gradients at each step. We also observe that lo-fi matches the baseline's performance when fine-tuning OPT language models (up to 1.3B parameters) on Common Crawl. By removing the communication requirement, lo-fi reduces resource barriers for fine-tuning large models and enables fine-tuning in settings with prohibitive communication cost.
研究动机与目标
- 探究在大型预训练模型的分布式微调过程中,节点间通信是否为必要。
- 通过消除节点间通信,降低微调大型模型的资源与基础设施门槛。
- 评估在微调后对独立训练模型进行平均,是否能与具有梯度同步的标准数据并行微调方法性能相当或更优。
- 探索在通信成本高昂或存在隐私约束的场景下,去中心化、低通信量微调的可行性。
提出的方法
- 每个节点在其自身数据分区上独立执行完整的微调,期间不进行任何梯度交换或同步。
- 训练完成后,通过在所有节点之间平均学习到的权重来构建最终模型:θ_lo-fi = (1/n) Σ θ^k。
- 该方法使用与基线相同的超参数和总数据量,仅改变通信模式。
- 微调使用标准优化方法,包含权重衰减和随机深度,该方法应用于视觉(DeiT)和语言(OPT)模型。
- 在 ImageNet 和分布偏移基准(IN-V2、IN-R、Sketch、IN-A)上评估该方法,以衡量其鲁棒性。
- 将该方法与在每一步都同步梯度的基线进行比较,且对超参数进行了最优性能调优。
实验结果
研究问题
- RQ1是否可以在不进行任何节点间通信的情况下实现分布式微调,同时保持或提升模型准确率?
- RQ2在微调后对独立训练的模型进行平均,其性能是否可与具有梯度同步的标准数据并行微调方法相当?
- RQ3当通信成本较高时,lo-fi 在分布偏移下的表现如何,相较于基线有何差异?
- RQ4在哪些场景下,lo-fi 能够优于或匹配基线,特别是在数据效率和模型规模方面?
主要发现
- lo-fi 在 ImageNet 上使用 DeiT-base 模型达到 86.00% 的 top-1 准确率,与基线的 85.96% 相当,同时消除了通信开销。
- 在分布偏移基准测试中,lo-fi 表现优于基线:在 IN-V2 上提升 1.51%,在 Sketch 上提升 1.19%,在 IN-A 上提升 1.38%(DeiT-base 模型)。
- 对于 DeiT-large 模型,lo-fi 在 ImageNet 上达到 87.10% 的准确率,与基线的 87.12% 相当,并在 IN-R 上提升 0.07%,在 IN-A 上提升 0.56%。
- lo-fi 在 OPT 语言模型(最大达 1.3B 参数)上无需通信即可保持性能,其在 Common Crawl 数据集上的准确率与基线相当。
- 该方法将通信成本降至零,使得在通信开销过高或存在隐私约束的环境中也能进行微调。
- 当不引入新参数时,lo-fi 表现最佳;当增加额外参数时,性能下降,需更多数据才能达到基线水平。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。