[论文解读] Optimal Transport for Deep Joint Transfer Learning
本文提出一种联合迁移学习网络(JTLN),通过使用最优传输(OT)损失联合微调源域和目标域数据上的深度神经网络,对齐分类器预测结果,从而提升少样本分类性能。通过引入可定制的代价矩阵来融入先验知识,JTLN 在细粒度飞机分类数据集上的表现优于标准微调和联合微调方法。
Training a Deep Neural Network (DNN) from scratch requires a large amount of labeled data. For a classification task where only small amount of training data is available, a common solution is to perform fine-tuning on a DNN which is pre-trained with related source data. This consecutive training process is time consuming and does not consider explicitly the relatedness between different source and target tasks. In this paper, we propose a novel method to jointly fine-tune a Deep Neural Network with source data and target data. By adding an Optimal Transport loss (OT loss) between source and target classifier predictions as a constraint on the source classifier, the proposed Joint Transfer Learning Network (JTLN) can effectively learn useful knowledge for target classification from source data. Furthermore, by using different kind of metric as cost matrix for the OT loss, JTLN can incorporate different prior knowledge about the relatedness between target categories and source categories. We carried out experiments with JTLN based on Alexnet on image classification datasets and the results verify the effectiveness of the proposed JTLN in comparison with standard consecutive fine-tuning. This Joint Transfer Learning with OT loss is general and can also be applied to other kind of Neural Networks.
研究动机与目标
- 通过利用相关源数据来解决少样本图像分类中的数据稀缺问题。
- 克服连续微调方法的局限性,后者忽略了源域与目标域任务之间的相关性。
- 开发一种显式建模源类别与目标类别之间关系的联合训练框架。
- 通过在最优传输损失中使用灵活的代价矩阵,实现对类别相似性的先验知识整合。
- 在细粒度图像分类基准上验证所提方法的有效性。
提出的方法
- 使用共享的特征提取主干网络和独立的分类头,联合在源域和目标域数据上训练深度神经网络。
- 在源域和目标域分类器输出之间引入最优传输(OT)损失,以最小化分布差异。
- 将Wasserstein损失推广至处理长度不同的概率测度,使用预定义的代价矩阵。
- 利用从特征(如fc7层)计算的不同代价度量(如MK-MMD和基于OT的距离),编码关于类别相关性的先验知识。
- 以组合损失进行网络训练:在两个分类器上使用标准交叉熵损失,并将OT损失作为正则化项。
- 将方法应用于在ImageNet上微调的AlexNet,其中早期层固定,后期层进行微调。
实验结果
研究问题
- RQ1与标准的连续微调相比,使用OT损失的联合微调是否能提升少样本分类性能?
- RQ2通过不同代价矩阵整合关于类别相关性的先验知识,对模型性能有何影响?
- RQ3所提出的JTLN框架是否能在不同神经网络架构和数据集上实现泛化?
- RQ4源域规模和类别重叠度对基于OT的对齐效果有何影响?
- RQ5OT损失是否能在不依赖共享标签空间的情况下,有效弥合源域与目标域分类器之间的差距?
主要发现
- 在ITL-Airbus数据集上,使用MK-MMD代价度量的JTLN将准确率从0.5497提升至0.5982,实现了5个百分点的准确率提升。
- 在ITL-Boeing数据集上,JTLN(fc7MKMMD)将准确率从0.5395提升至0.5422,JTLN(fc7OT)从0.5395提升至0.5436。
- 在源域更大的数据集(如ITL-Airbus,含87个源类别)上,性能提升更为显著,而在源域较小的数据集(如ITL-Boeing,含78个源类别)上提升较小。
- 连续微调在波音和空中客车数据集上的准确率分别为0.5286和0.545,均被所有JTLN变体超越。
- 不使用OT损失的联合微调准确率分别为0.5395和0.5497,表明OT损失在联合训练基础上提供了额外的性能增益。
- 结果证实,通过OT损失显式建模源域与目标域任务的相关性,可显著提升归纳迁移学习中的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。