Skip to main content
QUICK REVIEW

[论文解读] Near-Optimal Linear Regression under Distribution Shift

Qi Lei, Wei Hu|arXiv (Cornell University)|Jun 23, 2021
Machine Learning and Algorithms被引用 4
一句话总结

本文提出了一种在分布偏移下进行线性回归的近最小最大线性估计器,利用有标签的源域数据和无标签的目标域数据。通过基于估计的输入协方差自适应正则化,该方法在协变量偏移和模型偏移设置下,实现的风险在常数因子范围内接近最小最大最优风险,理论和实践中均显著优于岭回归。

ABSTRACT

Transfer learning is essential when sufficient data comes from the source domain, with scarce labeled data from the target domain. We develop estimators that achieve minimax linear risk for linear regression problems under distribution shift. Our algorithms cover different transfer learning settings including covariate shift and model shift. We also consider when data are generated from either linear or general nonlinear models. We show that linear minimax estimators are within an absolute constant of the minimax risk even among nonlinear estimators for various source/target distributions.

研究动机与目标

  • 解决目标域数据稀缺但源域数据丰富的分布偏移下的线性回归挑战。
  • 开发在协变量偏移和模型偏移下实现近最小最大风险的估计器。
  • 刻画线性估计器在何种条件下可达到与非线性估计器相差常数因子以内的性能。
  • 在标准数据集中浓度假设下,提供风险界理论保证。
  • 在分布偏移存在的情况下,证明数据依赖正则化相较于标准岭回归的优越性。

提出的方法

  • 提出一种两阶段元算法,利用有标签的源域数据和无标签的目标域数据来估计最优线性估计器。
  • 使用无标签目标域数据的样本协方差矩阵来自适应正则化,从而增强对输入分布偏移的鲁棒性。
  • 将风险最小化问题表述为在线性估计器上的矩阵优化问题,并通过偏差-方差分解分析最坏情况风险。
  • 在输入特征满足次高斯假设的前提下,建立估计协方差的高概率浓度界。
  • 证明在第二阶矩矩阵可交换的条件下,估计器的风险在常数因子范围内接近最小最大风险,即使在所有非线性估计器中也是如此。
  • 推导出理论分离结果,表明相比岭回归,性能提升因子为 $\tilde{O}(d^{-1/4})$。

实验结果

研究问题

  • RQ1在线性回归的分布偏移下,线性估计器能否实现近最小最大风险?
  • RQ2基于目标域协方差的数据依赖正则化相比固定正则化(如岭回归)如何提升性能?
  • RQ3在何种条件下线性估计器可达到与非线性估计器相差常数因子以内的性能?
  • RQ4在协变量偏移下,岭回归与最小最大最优估计器之间的理论差距是多少?
  • RQ5当源域和目标域输入协方差矩阵可交换时,所提方法表现如何?

主要发现

  • 所提估计器在所有线性估计器中,其最坏情况风险在常数因子范围内接近最小最大风险,即使在一般非线性数据模型下也成立。
  • 当源域和目标域的二阶矩矩阵可交换时,该估计器在所有可能估计器(包括非线性估计器)中均实现近最小最大风险。
  • 该方法在协变量偏移下,相比岭回归在风险上实现了 $\tilde{O}(d^{-1/4})$ 的理论改进因子。
  • 理论分析证实,基于无标签目标数据信息的数据依赖正则化对于缓解分布偏移导致的性能下降至关重要。
  • 实证结果验证了所提估计器在各种分布偏移场景下显著优于岭回归和启发式基线方法。
  • 在输入特征满足标准次高斯假设下,风险界具有鲁棒性,且估计协方差具有高概率浓度特性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。