Skip to main content
QUICK REVIEW

[论文解读] Distributed Deep Transfer Learning by Basic Probability Assignment

Arash Shahriari|arXiv (Cornell University)|Oct 20, 2017
Domain Adaptation and Few-Shot Learning参考文献 12被引用 3
一句话总结

本文提出了一种分布式深度迁移学习框架,通过证据理论中的基本概率分配(BPA)联合反向传播,对卷积滤波器进行独立微调。通过利用BPA解决类别不平衡问题并降低优化复杂度,该方法在多个基准测试中,尤其是在类别不平衡和跨域设置下,相较于标准迁移学习实现了稳定性能提升。

ABSTRACT

Transfer learning is a popular practice in deep neural networks, but fine-tuning of large number of parameters is a hard task due to the complex wiring of neurons between splitting layers and imbalance distributions of data in pretrained and transferred domains. The reconstruction of the original wiring for the target domain is a heavy burden due to the size of interconnections across neurons. We propose a distributed scheme that tunes the convolutional filters individually while backpropagates them jointly by means of basic probability assignment. Some of the most recent advances in evidence theory show that in a vast variety of the imbalanced regimes, optimizing of some proper objective functions derived from contingency matrices prevents biases towards high-prior class distributions. Therefore, the original filters get gradually transferred based on individual contributions to overall performance of the target domain. This largely reduces the expected complexity of transfer learning whilst highly improves precision. Our experiments on standard benchmarks and scenarios confirm the consistent improvement of our distributed deep transfer learning strategy.

研究动机与目标

  • 解决由于复杂的层间连接和参数耦合导致的大规模深度神经网络微调计算复杂度过高的问题。
  • 缓解因源域与目标域之间类别不平衡导致的迁移学习性能下降问题。
  • 将迁移学习的非凸优化问题分解为分布式、独立的滤波器微调,同时保持联合反向传播。
  • 通过引入证据理论中的基本概率分配(BPA),改善迁移学习中的泛化能力和精度,以更好地处理类别不平衡的数据分布。
  • 在包括MNIST、SVHN和CIFAR数据集在内的多样化真实世界基准上,展示一致的性能提升。

提出的方法

  • 对卷积滤波器进行独立微调,以降低迁移学习中非凸优化的复杂度。
  • 采用代价敏感方案,联合反向传播所有滤波器,整合来自混淆矩阵的误分类代价。
  • 应用证据理论中的基本概率分配(BPA),根据滤波器在目标域中的表现,为其贡献分配概率权重。
  • 从分类结果构建列联表(混淆矩阵),以指导BPA,从而在类别不平衡的情况下对性能进行正则化。
  • 利用混淆矩阵推导精确率、召回率和拒识率,实现基于信息的合理概率分配,降低对高先验类别偏差。
  • 在高度类别不平衡的设置下,计算BPA时合并训练集和验证集,以更好地捕捉数据分布偏移。

实验结果

研究问题

  • RQ1在深度神经网络中,对单个卷积滤波器进行分布式微调是否能降低迁移学习的计算负担?
  • RQ2证据理论中的基本概率分配(BPA)在类别不平衡的迁移学习场景中如何提升性能?
  • RQ3对独立微调的滤波器进行联合反向传播,是否在精确率和泛化能力方面优于标准的端到端微调?
  • RQ4在源域与目标域类别分布显著不同的情况下,使用混淆矩阵和BPA如何影响模型性能?
  • RQ5在高度类别不平衡的迁移任务中,基于训练集与验证集联合计算的BPA是否比仅基于训练集计算的BPA带来更好的泛化性能?

主要发现

  • 分布式反向传播策略在迁移学习中显著优于标准反向传播,尤其在如MNIST到SVHN和CIFAR-100等类别不平衡数据集上表现突出。
  • 在MNIST → SVHN迁移任务中,分布式方法将测试误差从标准方法的29.57%降低至5.18%,展现出在类别不平衡条件下的强大泛化能力。
  • 在CIFAR-10 → CIFAR-100迁移任务中,分布式方法的测试误差为54.32%,而标准反向传播为68.44%,表明尽管存在领域偏移,性能仍得到提升。
  • 在CIFAR-100 → SVHN迁移任务中,分布式方法将测试误差从标准方法的12.18%降低至7.25%,表明其对数据分布不匹配的处理能力更强。
  • 在训练集与验证集联合计算BPA时,性能优于仅使用训练集计算的情况,尤其在源类别较少而目标类别较多的场景下表现更优。
  • 在从CIFAR-10向MNIST迁移时,该方法性能与基线模型相当,表明即使在差异较大的任务之间,也能实现有效的知识迁移。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。