Skip to main content
QUICK REVIEW

[論文レビュー] Correcting the bias in least squares regression with volume-rescaled sampling

Michał Dereziński, Manfred K. Warmuth|arXiv (Cornell University)|Oct 4, 2018
Medical Image Segmentation Techniques参考文献 12被引用数 5
ひとこと要約

本稿では、確率的設計下での最小二乗回帰におけるバイアスを補正する手法を提案する。i.i.d.標本にサイズ$d$のボリューム・リスケールド標本を追加することで、結合推定量が不偏となるように保証する。このアプローチはボリューム・リスケールドサンプリングを用いる。ここで、点はそれらが形成する体積の二乗に比例した確率で抽出される。これにより、完全な分布が未知であっても不偏推定が可能になる。

ABSTRACT

Consider linear regression where the examples are generated by an unknown distribution on $R^d imes R$. Without any assumptions on the noise, the linear least squares solution for any i.i.d. sample will typically be biased w.r.t. the least squares optimum over the entire distribution. However, we show that if an i.i.d. sample of any size k is augmented by a certain small additional sample, then the solution of the combined sample becomes unbiased. We show this when the additional sample consists of d points drawn jointly according to the input distribution that is rescaled by the squared volume spanned by the points. Furthermore, we propose algorithms to sample from this volume-rescaled distribution when the data distribution is only known through an i.i.d sample.

研究の動機と目的

  • データが未知の分布からi.i.d.で抽出される場合に生じる最小二乗推定量の固有のバイアスに対処すること。特に、確率的設計設定において有効であることを目的とする。
  • 正則化なしで、ノイズ分布が任意であっても不偏な最小二乗推定量を生成する手法を開発すること。
  • 入力特徴量の連続的分布への一般化として、入力特徴量の関数としてのジョイント分布を用いたボリューム・リスケールドサンプリングを導入することで、離散的ボリュームサンプリングを連続的分布へ一般化すること。
  • 元の分布からのi.i.d.標本のみが利用可能な状況で、ボリューム・リスケールド分布からのサンプリングを効率的に実行するアルゴリズムを提供すること。
  • 特にガウス分布や有界サポートを持つ分布に対して、ボリューム・リスケールドサンプリングの時間計算量と標本計算量を改善すること。

提案手法

  • サイズ$k$の任意のi.i.d.標本に、点が形成する体積の二乗に比例してリスケールされた分布から抽出されたサイズ$d$の標本を追加する。
  • Cauchy-Binetの公式を用いて、結合標本がサイズ$k+d$のボリューム・リスケールドサンプリングに従うことを示し、最小二乗解の不偏性を保証する。
  • 行列式に基づく拒否サンプリング(determinantal rejection sampling)を用いた、連続領域におけるボリューム・リスケールドサンプリングの新しいアルゴリズムを提案し、$O(d)$の時間計算量を達成した。
  • 未知の共分散行列を有するガウス分布に対しては、ボリューム・リスケールドサンプリングのための新しいアルゴリズムを導入し、$O(d)$の標本計算量を達成した。
  • 行列チェルノフの不等式を用いて、$K_{D_{ ext{X}}}$を真の共分散行列の条件数とするとき、$O(K_{D_{ ext{X}}} d \text{ poly}(\text{log}(d/\nu)))$標本で共分散行列を高確率で推定できることを示した。
  • 拒否サンプリングの成功確率を下界付けるために、Kantorovichの不等式と調和平均の不等式を用い、1回の反復で定数の成功確率を保証した。

実験結果

リサーチクエスチョン

  • RQ1ノイズ分布が未知であっても、正則化なしで確率的設計下の最小二乗回帰のバイアスを補正することは可能か?
  • RQ2サンプルされた点が形成する体積の二乗に比例してサンプリング分布をリスケールすることで、離散的ボリュームサンプリングを連続的分布へ一般化することは可能か?
  • RQ3元の分布からのi.i.d.標本のみが利用可能な状況で、ボリューム・リスケールドサンプリングの時間計算量と標本計算量はどの程度か?
  • RQ4行列濃度不等式を用いて、ボリューム・リスケールドサンプリングのための拒否サンプリングの成功確率を下界付け、改善することは可能か?
  • RQ5ガウス分布などの特定の分布族に対して、ボリューム・リスケールドサンプリングを著しく低い標本計算量で実行することは可能か?

主な発見

  • サイズ$k$の任意のi.i.d.標本にサイズ$d$のボリューム・リスケールド標本を追加すると、結合標本はサイズ$k+d$のボリューム・リスケールドサンプリングに従い、最小二乗解が不偏であることが保証される。
  • ボリューム・リスケールドサンプリングのための拒否サンプリング手順の成功確率は、Kantorovichの不等式と調和平均の不等式を用いることで、少なくとも$1/4$に下界付けられる。
  • 改善された行列式に基づく拒否サンプリングの時間計算量は、先行研究と比較して$d$倍改善され、1回のサンプルあたり$O(d^4)$の計算量を達成した。
  • 未知の共分散行列を有するガウス分布に対しては、提案されたアルゴリズムがボリューム・リスケールドサンプリングにおいて$O(d)$の標本計算量を達成した。
  • データ分布の共分散行列は、$K_{D_{ ext{X}}}$を真の共分散行列の条件数とするとき、$O(K_{D_{ ext{X}}} d \text{ poly}(\text{log}(d/\nu)))$標本で高確率に推定可能である。
  • 拒否サンプリングのループに必要な反復回数は、高確率$1-\delta$で$O(\ln(1/\delta))$に上限付けられており、収束が効率的であることが保証されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。