[论文解读] Adaptive Consistency Regularization for Semi-Supervised Transfer Learning
本论文提出了一种用于半监督迁移学习的自适应一致性正则化方法,引入了自适应知识一致性(AKC)来基于置信度采样选择,将预训练源模型的知识蒸馏到目标模型中,并提出了自适应表示一致性(ARC)通过动态采样最小化最大均值差异(MMD)来对齐有标签和无标签目标样本的表示。该方法在低标签设置下优于当前最先进的半监督学习技术(如FixMatch和MixMatch),且与现有方法正交,可进一步提升性能。
While recent studies on semi-supervised learning have shown remarkable progress in leveraging both labeled and unlabeled data, most of them presume a basic setting of the model is randomly initialized. In this work, we consider semi-supervised learning and transfer learning jointly, leading to a more practical and competitive paradigm that can utilize both powerful pre-trained models from source domain as well as labeled/unlabeled data in the target domain. To better exploit the value of both pre-trained weights and unlabeled target examples, we introduce adaptive consistency regularization that consists of two complementary components: Adaptive Knowledge Consistency (AKC) on the examples between the source and target model, and Adaptive Representation Consistency (ARC) on the target model between labeled and unlabeled examples. Examples involved in the consistency regularization are adaptively selected according to their potential contributions to the target task. We conduct extensive experiments on popular benchmarks including CIFAR-10, CUB-200, and MURA, by fine-tuning the ImageNet pre-trained ResNet-50 model. Results show that our proposed adaptive consistency regularization outperforms state-of-the-art semi-supervised learning techniques such as Pseudo Label, Mean Teacher, and FixMatch. Moreover, our algorithm is orthogonal to existing methods and thus able to gain additional improvements on top of MixMatch and FixMatch. Our code is available at https://github.com/SHI-Labs/Semi-Supervised-Transfer-Learning.
研究动机与目标
- 为解决半监督学习与迁移学习系统性整合的空白,特别是在利用强大预训练模型时。
- 通过有效利用目标域中的有标签和无标签数据,在低数据量场景下提升泛化能力。
- 通过自适应选择可靠样本进行知识蒸馏,减轻源模型带来的负迁移。
- 通过动态选择高置信度无标签样本进行一致性正则化,增强表示学习。
- 开发一种与现有半监督学习方法正交的框架,使其在组合使用时可进一步提升性能。
提出的方法
- 提出自适应知识一致性(AKC),通过基于源模型输出熵的置信度阈值,强制同一目标样本在源模型和目标模型中的预测保持一致。
- 在AKC中采用动态阈值机制:仅使用预测熵低于 ε_K = 0.7·log(C_s) 的样本,以降低负迁移风险。
- 提出自适应表示一致性(ARC),通过最小化有标签和无标签目标样本表示之间的最大均值差异(MMD)来对齐其分布。
- 在ARC中采用基于置信度的采样策略,其中阈值 ε_R = 0.5·log(C_t) 控制用于MMD正则化的高置信度无标签样本比例。
- 在ARC中实现类似课程学习的行为:随着训练轮次的推进,所选样本数量逐渐增加,初始从低置信度样本开始,随模型置信度提升逐步扩展至更多样本。
- 将AKC与ARC整合为统一的端到端训练框架,对在ImageNet上预训练的模型进行微调,适用于目标数据集上标签数据有限的场景。
实验结果
研究问题
- RQ1自适应一致性正则化能否通过结合预训练模型和目标数据中的无标签数据,提升半监督迁移学习性能?
- RQ2在知识蒸馏和表示对齐中采用自适应采样策略,在少样本学习场景下的性能影响如何?
- RQ3所提出的方法在迁移学习设置下是否优于现有最先进的半监督学习技术(如FixMatch和MixMatch)?
- RQ4所提出的正则化组件是否可推广至半监督迁移学习之外的其他学习范式?
- RQ5与非自适应基线相比,自适应采样在提升鲁棒性和泛化能力方面有多显著?
主要发现
- 在CUB-200-2011数据集上使用400个有标签样本时,所提方法达到41.88%的准确率,较非自适应ARC高出5.7%。
- 在CUB-200-2011数据集上使用400个有标签样本时,采用 ε_K = 0.7·log(C_s) 的AKC相比非自适应AKC性能提升11.8%。
- 在CIFAR-10数据集上使用2000个有标签样本时,方法达到71.33%的准确率,优于伪标签(Pseudo Label)、均值教师(Mean Teacher)和FixMatch。
- 与MixMatch和FixMatch结合使用时,所提方法进一步提升了性能,证明其与现有半监督学习技术正交。
- 在CUB-200-2011数据集的完全监督迁移学习设置下,结合AKC与ARC使准确率从81.77%提升至83.52%。
- ARC中的自适应采样策略表现出类似课程学习的行为,所用样本比例从训练前10个周期的30%逐步提升至90%,提升了训练稳定性和泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。