Skip to main content
QUICK REVIEW

[论文解读] A novel transfer learning method based on common space mapping and weighted domain matching

Ru‐Ze Liang, Wei Xie|arXiv (Cornell University)|Aug 16, 2016
Domain Adaptation and Few-Shot Learning参考文献 33被引用 11
一句话总结

本文提出了一种新颖的迁移学习方法,通过线性变换将源域和目标域数据映射到一个公共空间,然后利用加权域匹配和局部重建正则化来匹配其分布。该方法在基准数据集上的表现优于当前最先进方法,在 20-Newsgroup 数据集上达到 62.10% 的准确率,在 Amazon 数据集上达到 78.12%,在 Spam 邮件数据集上达到 86.41%。

ABSTRACT

In this paper, we propose a novel learning framework for the problem of domain transfer learning. We map the data of two domains to one single common space, and learn a classifier in this common space. Then we adapt the common classifier to the two domains by adding two adaptive functions to it respectively. In the common space, the target domain data points are weighted and matched to the target domain in term of distributions. The weighting terms of source domain data points and the target domain classification responses are also regularized by the local reconstruction coefficients. The novel transfer learning framework is evaluated over some benchmark cross-domain data sets, and it outperforms the existing state-of-the-art transfer learning methods.

研究动机与目标

  • 解决迁移学习中源域和目标域数据分布显著不同的领域偏移问题。
  • 通过利用标签信息和数据结构关系,提升低资源目标域的分类性能。
  • 克服先前方法忽略标签信息、局部数据连通性或源域样本重要性差异的局限性。
  • 构建一个统一框架,学习公共空间中的共享分类器,并通过自适应函数将其适应到两个域。
  • 整合局部重建系数以正则化权重学习和分类响应,提升模型的鲁棒性和泛化能力。

提出的方法

  • 使用线性变换矩阵 $\Theta$ 将源域和目标域数据映射到一个低维公共空间。
  • 最小化公共空间中源域数据点加权均值与目标域数据点均值之间的 $\ell_2$-范数距离。
  • 引入自适应函数 $\mathbf{u}^\top\mathbf{x}^s$ 和 $\mathbf{v}^\top\mathbf{x}^t$,分别将公共分类器适应到源域和目标域。
  • 利用邻近点的局部重建系数对源域样本的加权因子 $\pi_i$ 进行正则化。
  • 利用局部重建系数对目标域的分类响应进行正则化,以保持局部结构。
  • 将学习问题表述为约束二次优化问题,并使用活动集算法迭代求解。

实验结果

研究问题

  • RQ1如何在共享表示空间中有效对齐源域和目标域的分布?
  • RQ2对源域数据进行加权采样在提升领域对齐和分类准确率方面起到什么作用?
  • RQ3如何通过重建系数捕捉的局部数据结构来增强迁移学习模型的鲁棒性?
  • RQ4将公共空间映射与自适应分类器相结合,是否能在跨域基准上超越现有迁移学习方法?
  • RQ5在低监督设置下,目标域标签信息的整合如何提升泛化能力?

主要发现

  • 所提方法在 20-Newsgroup 基准测试中达到 62.10% 的分类准确率,显著优于 Chen 等人提出的次佳方法(58.15%)。
  • 在 Amazon 评论数据集上,该方法达到 78.12% 的准确率,超过第二好的方法(76.21%)的 Chen 等人。
  • 在 Spam 邮件数据集上,该方法实现 86.41% 的准确率,超过基线方法(85.14%)的 Chen 等人。
  • 局部重建正则化的引入通过在源域和目标域中保持局部数据结构,提升了模型的鲁棒性。
  • 迭代活动集算法能有效求解约束优化问题,实现稳定收敛和高性能。
  • 实证结果证实,联合优化领域对齐、标签利用和局部结构可带来在多样化跨域任务中的一致性提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。