Skip to main content
QUICK REVIEW

[論文レビュー] Online Robust Regression via SGD on the l1 loss

Scott Pesme, Nicolas Flammarion|arXiv (Cornell University)|Jul 1, 2020
Sparse and Compressive Sensing Techniques参考文献 84被引用数 12
ひとこと要約

本稿では、ストリーミングデータにおける悪意ある外れ値を扱うために、確率的勾配降下法(SGD)を用いたℓ₁損失に基づくオンラインロバスト回帰アルゴリズムを提案する。ガウス的特徴の平滑化効果とPolyak-Ruppert平均化を活用することで、収束速度がÕ(1/n)に達し、バッチ処理や外れ値検出を必要とせずに、高比率の外れ値(η < 1)下でも真のパラメータを一貫して回復可能である。

ABSTRACT

We consider the robust linear regression problem in the online setting where we have access to the data in a streaming manner, one data point after the other. More specifically, for a true parameter $θ^*$, we consider the corrupted Gaussian linear model $y = \langle x , \ θ^* angle + \varepsilon + b$ where the adversarial noise $b$ can take any value with probability $η$ and equals zero otherwise. We consider this adversary to be oblivious (i.e., $b$ independent of the data) since this is the only contamination model under which consistency is possible. Current algorithms rely on having the whole data at hand in order to identify and remove the outliers. In contrast, we show in this work that stochastic gradient descent on the $\ell_1$ loss converges to the true parameter vector at a $ ilde{O}( 1 / (1 - η)^2 n )$ rate which is independent of the values of the contaminated measurements. Our proof relies on the elegant smoothing of the non-smooth $\ell_1$ loss by the Gaussian data and a classical non-asymptotic analysis of Polyak-Ruppert averaged SGD. In addition, we provide experimental evidence of the efficiency of this simple and highly scalable algorithm.

研究の動機と目的

  • ストリーミングデータにおける悪意ある汚染下でも効率的かつスケーラブルなオンラインアルゴリズムを、ロバスト線形回帰に開発すること。
  • 測定値の一部を占領する無知の敵(oblivious adversary)が存在する状況でも、真のパラメータを一貫して回復できることを実現すること。
  • 完全なデータアクセスを必要とするバッチアルゴリズムの限界を克服し、大規模またはリアルタイム応用に不適切であることを回避すること。
  • 強い凸性が成り立たない状況でも、唯一ℓ₁損失とSGDを用いて最適な非漸近的収束速度を達成すること。
  • SGDがℓ₁損失に対して、オンライン設定において統計的に最適かつ計算的にスケーラブルであることを示すこと。

提案手法

  • アルゴリズムは、期待値を取ったℓ₁損失 E[|y − ⟨x, θ⟩|] に対して、平均化された確率的勾配降下法(SGD)を用いる。
  • 真のパラメータθ*の周辺で局所的強い凸性を実現するために、非滑らかであるℓ₁損失がガウス的設計行列によって平滑化されることを活用する。
  • 非強い凸性設定におけるより速い収束速度を達成するために、Polyak-Ruppert平均化を適用する。
  • アルゴリズムは本質的にオンラインであり、1つのデータポイントずつ処理するため、大規模およびストリーミング応用に適している。
  • 分析は、最近の確率的近似および平均化SGDの非漸近的解析の進展に依存している。
  • 特徴量のノルムの上界のみを必要とするため、実用上ほぼパrameter-freeである。

実験結果

リサーチクエスチョン

  • RQ1悪意ある外れ値汚染下でも、ℓ₁損失における確率的勾配降下法が、オンラインロバスト回帰で高速な収束を達成できるか?
  • RQ2ガウス的特徴の平滑化効果が、非滑らかで非強い凸性を持つ問題において、強い凸性に類似した振る舞いを生み出し、収束を加速できるか?
  • RQ3非微分可能なℓ₁損失に対しても、平均化SGDがÕ(1/n)の収束速度を達成できるか?
  • RQ4アルゴリズムは高い外れ値割合(η < 1)に耐えられ、特徴量の悪条件性に敏感でないか?
  • RQ5シンプルでスケーラブルなオンラインアルゴリズムが、効率性と統計的一致性の両面でバッチ手法を上回れるか?

主な発見

  • 提案されたアルゴリズムは、非漸近的収束速度Õ(1/(1−η)²n)を達成し、これは最適であり、外れ値の大きさに依存しない。
  • 収束速度は有効な外れ値割合˜η < ηに依存するため、敵の困難さに適応的である。
  • ℓ₁損失が非滑らかで非強い凸性を持つにもかかわらず、ガウス的平滑化とPolyak-Ruppert平均化のおかげで、O(1/n)の収束が達成される。
  • アルゴリズムは非常にスケーラブルであり、全データを保存する必要がないため、オンラインおよび大規模応用に適している。
  • 実験結果は、リアルタイム環境における外れ値検出および重尾ノイズ処理の面で、アルゴリズムの効率性とロバスト性を確認している。
  • アルゴリズムはほぼパrameter-freeであり、特徴量のノルムの上界のみを必要とするため、実用的利便性が向上する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。