Skip to main content
QUICK REVIEW

[论文解读] A Theory of Multiple-Source Adaptation with Limited Target Labeled Data

Yishay Mansour, Mehryar Mohri|arXiv (Cornell University)|Jul 19, 2020
Domain Adaptation and Few-Shot Learning参考文献 62被引用 6
一句话总结

本文提出了一类新型算法——LMSA、LMSA-Boost 和 LMSA-Min-max,用于在标注目标数据有限的情况下进行多源域自适应,通过模型选择与差异最小化策略,实现了强大的理论保证和实验性能。主要贡献在于接近最优的一般化边界以及在实验中表现出的优越准确性,尤其是在目标标签稀缺时表现更优。

ABSTRACT

We present a theoretical and algorithmic study of the multiple-source domain adaptation problem in the common scenario where the learner has access only to a limited amount of labeled target data, but where the learner has at disposal a large amount of labeled data from multiple source domains. We show that a new family of algorithms based on model selection ideas benefits from very favorable guarantees in this scenario and discuss some theoretical obstacles affecting some alternative techniques. We also report the results of several experiments with our algorithms that demonstrate their practical effectiveness.

研究动机与目标

  • 为解决在仅有少量标注目标数据可用、尽管源数据标注丰富的情况下,域自适应的挑战。
  • 开发具有理论基础的算法,有效结合多个源域以提升目标域的泛化能力。
  • 提供在目标监督数据有限时仍紧密且有利的学习保证。
  • 克服现有方法的理论局限,例如依赖成对差异或在低数据场景下边界较弱的问题。
  • 在标准多源自适应基准上实证验证所提算法,证明其优于基线方法。

提出的方法

  • 所提出的 LMSA 算法利用模型选择原则,结合来自多个源域的假设,以最小化源域与目标域之间的差异。
  • 核心方法最小化目标分布与源分布凸组合之间的差异 $\text{disc}_{\mathscr{H}}({\mathscr{D}}_0, {\mathscr{D}}_\lambda)$。
  • 该算法设计旨在受益于接近最优的一般化边界,且其性能随目标标注样本数量的增加而有利地扩展。
  • LMSA-Min-max 进一步通过优化差异的极小化-极大化公式提升性能,增强鲁棒性。
  • 该方法避免仅依赖未标注的目标数据,而是同时利用已标注的源数据和有限的已标注目标数据。
  • 实验采用标准 MSA 基准,包含 MNIST、MNIST-M、SVHN 和 SynthDigits,训练一个 CNN,并在多个基线之间比较性能。

实验结果

研究问题

  • RQ1基于模型选择的方法是否能在目标标签有限的多源域自适应中实现更好的泛化?
  • RQ2在目标数据较少的场景下,基于差异的边界与成对差异方法相比表现如何?
  • RQ3使用源域的凸组合与单独使用各源域相比,对目标性能有何影响?
  • RQ4对源权重进行极小化-极大化优化是否能提升多源自适应中的鲁棒性与准确性?
  • RQ5所提算法与将源和目标数据拼接或仅使用单一源的基线方法相比表现如何?

主要发现

  • 当全部 1280 个目标样本用作 $\widehat{{\mathscr{D}}}_0$ 时,LMSA-Min-max 算法在 SynthDigits 目标域上达到 91.7% 的准确率,优于其他基线方法。
  • LMSA-Boost 在 MNIST-M 目标域上达到 89.5% 的准确率,显著优于仅使用目标的基线和联合源方法。
  • LMSA 算法的性能随目标样本数量的增加而提升,其中 MNIST 因与源域更相似,仅需较少样本即可达到高准确率。
  • 当所有目标样本均用作 $\widehat{{\mathscr{D}}}_0$ 时,LMSA-Min-max 表现最佳;而 LMSA 和 LMSA-Boost 则更倾向于使用 1024 个样本作为新源,256 个样本作为目标数据。
  • 所提算法始终优于最佳单源和联合源基线,证明了结构化源组合相较于简单拼接的优越性。
  • 理论分析表明,学习保证接近最优,且对已标注目标样本数量具有有利依赖关系,边界形式为 $\tilde{\mathcal{O}}\left(\sqrt{\frac{d}{m_0}}\right)$。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。