Skip to main content
QUICK REVIEW

[论文解读] Correcting the bias in least squares regression with volume-rescaled sampling

Michał Dereziński, Manfred K. Warmuth|arXiv (Cornell University)|Oct 4, 2018
Medical Image Segmentation Techniques参考文献 12被引用 5
一句话总结

该论文提出一种方法,在随机设计下通过将独立同分布样本与大小为 $d$ 的体积重缩放样本相结合,校正最小二乘回归中的偏差,确保组合估计器无偏。该方法使用体积重缩放采样——其中点按其构成的体积平方成比例被抽取——即使在完整分布未知的情况下也能实现无偏估计。

ABSTRACT

Consider linear regression where the examples are generated by an unknown distribution on $R^d imes R$. Without any assumptions on the noise, the linear least squares solution for any i.i.d. sample will typically be biased w.r.t. the least squares optimum over the entire distribution. However, we show that if an i.i.d. sample of any size k is augmented by a certain small additional sample, then the solution of the combined sample becomes unbiased. We show this when the additional sample consists of d points drawn jointly according to the input distribution that is rescaled by the squared volume spanned by the points. Furthermore, we propose algorithms to sample from this volume-rescaled distribution when the data distribution is only known through an i.i.d sample.

研究动机与目标

  • 解决从未知分布中独立同分布采样时最小二乘估计器固有的偏差问题,特别是在随机设计设置下。
  • 开发一种无需正则化即可生成无偏最小二乘估计器的方法,即使噪声分布为任意分布。
  • 通过在输入特征上引入联合分布,将离散体积采样推广到连续分布,提出体积重缩放采样。
  • 当仅能获得底层分布的独立同分布样本时,提供从体积重缩放分布中采样的高效算法。
  • 在高斯分布和有界支撑分布下,实现体积重缩放采样的更优时间复杂度和样本复杂度。

提出的方法

  • 将任意大小为 $k$ 的独立同分布样本与从按点所构成体积平方重缩放分布中抽取的大小为 $d$ 的样本相结合。
  • 利用柯西-比内公式证明,组合样本遵循大小为 $k+d$ 的体积重缩放采样,从而保持最小二乘解的无偏性。
  • 提出一种新的连续域体积重缩放采样算法,采用行列式拒绝采样,时间复杂度提升至 $O(d)$。
  • 对于协方差未知的高斯分布,提出一种新算法,实现体积重缩放采样的 $O(d)$ 样本复杂度。
  • 利用矩阵切尔诺夫界,以高概率使用 $O(K_{D_{ ext{X}}} d \text{ poly}(\text{log}(d/\nu)))$ 个样本估计协方差矩阵,其中 $K_{D_{ ext{X}}}$ 为真实协方差的条件数。
  • 利用柯尔莫哥洛夫不等式和调和平均界,下界估计拒绝采样的成功概率,确保每次迭代的成功概率为常数。

实验结果

研究问题

  • RQ1在噪声分布未知的情况下,是否可以在不使用正则化的情况下校正随机设计下最小二乘回归的偏差?
  • RQ2是否可以通过按采样点所构成体积的平方重缩放采样分布,将离散体积采样推广到连续分布?
  • RQ3当仅能获得底层分布的独立同分布样本时,体积重缩放采样的时间复杂度和样本复杂度是多少?
  • RQ4是否可以利用矩阵集中不等式对体积重缩放采样的拒绝采样成功概率进行有界并加以改进?
  • RQ5是否存在某些分布族(如高斯分布),使得体积重缩放采样可实现显著降低的样本复杂度?

主要发现

  • 将任意大小为 $k$ 的独立同分布样本与大小为 $d$ 的体积重缩放样本结合,可使组合样本服从大小为 $k+d$ 的体积重缩放采样,从而确保最小二乘解无偏。
  • 体积重缩放采样拒绝采样程序的成功概率至少为 $1/4$,该结果通过柯尔莫哥洛夫不等式和调和平均界实现。
  • 改进的行列式拒绝采样时间复杂度相比先前工作降低 $d$ 倍,达到每次采样 $O(d^4)$。
  • 对于协方差未知的高斯分布,所提算法实现体积重缩放采样的 $O(d)$ 样本复杂度。
  • 数据分布的协方差矩阵可使用 $O(K_{D_{ ext{X}}} d \text{ poly}(\text{log}(d/\nu)))$ 个样本以高概率估计,其中 $K_{D_{ ext{X}}}$ 为条件数。
  • 拒绝采样循环所需的迭代次数以高概率 $1-\delta$ 有界于 $O(\ln(1/\delta))$,确保高效收敛。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。