Skip to main content
QUICK REVIEW

[论文解读] Cross-domain few-shot learning with unlabelled data

Fupin Yao|arXiv (Cornell University)|Jan 19, 2021
Domain Adaptation and Few-Shot Learning参考文献 25被引用 9
一句话总结

本文提出了一种新颖的跨域少样本学习设置,通过引入未标注的目标域数据来弥合域差距,提出一种自监督学习方法,显著优于基线模型。该方法在 DomainNet 上实现了最先进性能,跨多个目标域的平均少样本准确率达到 71.08%。

ABSTRACT

Few shot learning aims to solve the data scarcity problem. If there is a domain shift between the test set and the training set, their performance will decrease a lot. This setting is called Cross-domain few-shot learning. However, this is very challenging because the target domain is unseen during training. Thus we propose a new setting some unlabelled data from the target domain is provided, which can bridge the gap between the source domain and the target domain. A benchmark for this setting is constructed using DomainNet \cite{peng2018oment}. We come up with a self-supervised learning method to fully utilize the knowledge in the labeled training set and the unlabelled set. Extensive experiments show that our methods outperforms several baseline methods by a large margin. We also carefully design an episodic training pipeline which yields a significant performance boost.

研究动机与目标

  • 解决少样本学习中测试数据来自未见域时的域偏移问题。
  • 通过在训练过程中引入目标域的未标注数据,提出一种更真实且可行的新设置。
  • 在 DomainNet 上建立基准,以实现在此新设置下方法的公平比较。
  • 开发一种基于自监督学习的方法,有效利用已标注的源域数据和未标注的目标域数据。
  • 证明在未见域上,结合未标注数据的元训练(episodic training)能显著提升泛化能力。

提出的方法

  • 提出两阶段训练流程:首先在未标注的目标域数据上使用对比自监督学习预训练特征提取器。
  • 然后在已标注的源域数据上使用元训练(episodic training)进行微调,模拟少样本学习任务(如 5-way 1-shot 和 5-shot 任务)。
  • 在元训练过程中使用均值中心分类器来评估少样本泛化性能。
  • 利用未标注的目标域数据学习域不变且泛化性强的特征,从而减小源域与目标域之间的域偏移。
  • 设计一种稳健的训练循环,交替进行自监督预训练和基于元学习的微调。
  • 扩大未标注数据集规模,以研究其对性能的影响,结果表明更大的未标注数据集可提升泛化能力。

实验结果

研究问题

  • RQ1未标注的目标域数据是否能显著提升跨域设置下的少样本泛化能力?
  • RQ2与标准少样本学习相比,对未标注目标域数据进行自监督预训练在多大程度上能减少域差距?
  • RQ3未标注数据规模对跨域少样本学习中模型性能有何影响?
  • RQ4结合已标注源域数据和未标注目标域数据的元训练是否能带来优于基线的泛化性能?
  • RQ5统一框架能否有效结合自监督学习与元学习,实现跨域少样本适应?

主要发现

  • 所提方法在 DomainNet 上所有目标域上的平均准确率达到 71.08%,比最佳基线(Baseline1)高出 7.69 个百分点。
  • 在草图域(sketch domain)上,该方法准确率达到 71.51%,显著高于基线的 58.76%。
  • 消融实验表明,增加未标注数据集规模可提升基线性能,但所提方法仍以显著优势超越基线。
  • 元训练流程带来显著的性能提升,证明其在少样本泛化中的有效性。
  • 在未标注目标域数据上进行自监督预训练能有效减少域偏移,并增强特征泛化能力。
  • 在 DomainNet 上构建的基准为未来在未标注数据下的跨域少样本学习研究提供了可靠且真实的评估平台。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。