[论文解读] On the Value of Target Data in Transfer Learning
本文在源域和目标域样本量的框架下建立了迁移学习的极小极大率,引入了一类新颖的差异度量——迁移指数($\rho$ 和 $\gamma$),用于量化有标签和无标签目标数据的价值。研究发现,最优性能可通过忽略信息较少的源域或目标域数据集实现,并提出一种数据驱动的方法,在无需估计分布参数或 $\gamma$ 的情况下实现近似极小极大性能,从而实现采样成本最小化决策。
We aim to understand the value of additional labeled or unlabeled target data in transfer learning, for any given amount of source data; this is motivated by practical questions around minimizing sampling costs, whereby, target data is usually harder or costlier to acquire than source data, but can yield better accuracy. To this aim, we establish the first minimax-rates in terms of both source and target sample sizes, and show that performance limits are captured by new notions of discrepancy between source and target, which we refer to as transfer exponents.
研究动机与目标
- 理解在采样成本约束下,有标签和无标签目标数据在迁移学习中的价值。
- 建立依赖于源域样本量 ($n_P$) 和目标域样本量 ($n_Q$) 的迁移学习极小极大率。
- 开发无需依赖分布参数或差异度量知识的实用决策策略,如采样成本最小化和源域选择。
- 证明:当已知迁移指数时,仅通过忽略一个数据集的简单分类器即可实现最优性能。
提出的方法
- 引入两种新的差异度量:超额风险迁移指数 $\rho$ 和边缘迁移指数 $\gamma$,用于量化源域与目标域之间的分布差异。
- 基于 $n_P$、$n_Q$ 以及迁移指数 $\rho$ 和 $\gamma$,推导出一般有界 VC 类的极小极大率。
- 提出一种假设迁移方法,在保证源域误差较低的约束下优化目标域误差,且无需依赖 $\rho$ 或 $\gamma$ 的知识。
- 利用无标签目标数据 ($U_Q$) 估计重加权方案,实现在低采样复杂度下接近最优的性能。
- 应用鲁棒性条件(RCS)和 Bernstein 类假设,以在最小假设下界超额风险并确保收敛性。
- 采用一种数据驱动的选择规则,仅利用无标签数据和有标签源数据最小化超额风险的上界。
实验结果
研究问题
- RQ1当源域和目标域均有有标签数据时,迁移学习的最优收敛速率是什么?
- RQ2结合源域和目标域数据的分类器性能,与仅使用单一数据集相比如何?
- RQ3在迁移学习中,是否可以不估计分布参数或差异度量,即可做出实际决策,如采样成本最小化或源域选择?
- RQ4无标签目标样本在实现迁移学习极小极大最优性能中起到什么作用?
主要发现
- 在常数因子范围内,仅使用信息更丰富的源域或目标域数据集即可实现目标误差的极小极大最优率,即使两个数据集都可用。
- 以 $n_P$ 和 $n_Q$ 表示的最优率由迁移指数 $\rho$ 捕获,该指数衡量源域与目标域之间超额风险的差异。
- 一种仅依赖无标签数据和有标签源数据的、最小化超额风险上界的无参数数据驱动程序,可在不估计 $\rho$ 或 $\gamma$ 的情况下实现极小极大率,从而支持实际部署。
- 在输入边缘分布 $P_X$ 和 $Q_X$ 上定义的边缘迁移指数 $\gamma$,使得在涉及无标签数据和成本最小化的场景中能够实现最优决策。
- 当 $|U_Q| \geq n_P^{\frac{\beta_f}{(2 - \beta_f)\gamma_f}}$ 时,足够大小的无标签目标数据即可实现极小极大率,且采样复杂度较低。
- 该方法在标签噪声或分布偏移未知的情况下依然有效,且无需估计 $\gamma$。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。