Skip to main content
QUICK REVIEW

[論文レビュー] Learning with Non-Convex Truncated Losses by SGD

Yi Xu, Shenghuo Zhu|arXiv (Cornell University)|May 21, 2018
Statistical Methods and Inference参考文献 32被引用数 7
ひとこと要約

本論文は、重尾ノイズと外れ値の下で頑健な学習のための非凸な切り捨て損失フレームワークを提案し、経験的リスクを最小化するために確率的勾配降下法(SGD)を用いる。近似停留点における超過リスクバウンドと統計的誤差の保証を確立し、浅いおよび深い学習の両設定において、ノイズ分布の事前知識を必要とせずに、より優れた頑健性を示す。

ABSTRACT

Learning with a {\it convex loss} function has been a dominating paradigm for many years. It remains an interesting question how non-convex loss functions help improve the generalization of learning with broad applicability. In this paper, we study a family of objective functions formed by truncating traditional loss functions, which is applicable to both shallow learning and deep learning. Truncating loss functions has potential to be less vulnerable and more robust to large noise in observations that could be adversarial. More importantly, it is a generic technique without assuming the knowledge of noise distribution. To justify non-convex learning with truncated losses, we establish excess risk bounds of empirical risk minimization based on truncated losses for heavy-tailed output, and statistical error of an approximate stationary point found by stochastic gradient descent (SGD) method. Our experiments for shallow and deep learning for regression with outliers, corrupted data and heavy-tailed noise further justify the proposed method.

研究の動機と目的

  • 機械学習における重尾ノイズと外れ値の存在下で、凸損失関数の限界を克服すること。
  • ノイズ特性の事前知識を必要としない、一般的で分布に依存しない頑健な学習手法の開発。
  • 浅いおよび深い学習の両方において、経験的リスク最小化(ERM)における非凸的切り捨て損失の使用を理論的に正当化すること。
  • 切り捨て損失の下で、SGDが近似停留点をどのように特定するかの統計的性能の分析。
  • 外れ値や重尾ノイズを含む破損データを用いた回帰タスクにおいて、提案手法の実証的検証。

提案手法

  • 本論文は、ℓ(h(xi), yi) を標準損失関数とし、φ を大きな値を切り捨てることで外れ値への感受性を低減する非凸的切り捨て損失関数の族を導入する。
  • 訓練データ上の平均切り捨て損失を最小化するように、切り捨て損失関数を用いた経験的リスク最小化(ERM)問題を定式化する。
  • 理論的分析により、重尾出力分布下での切り捨て損失を用いた ERM の超過リスクバウンドを確立する。
  • 切り捨て損失フレームワーク下で、SGD が得る近似停留点の統計的誤差バウンドを導出する。
  • ノイズ分布の仮定は、超指数的または重尾的挙動を除き一切行わず、浅いおよび深い学習モデルに適用可能である。
  • アプローチは汎用的であり、ノイズ分布の事前知識を必要としないため、異常を含む現実世界のデータに広く適用可能である。

実験結果

リサーチクエスチョン

  • RQ1非凸的切り捨て損失関数は、重尾ノイズと外れ値の存在下で一般化性能を向上させることができるか?
  • RQ2SGD を用いた切り捨て損失の下で、超過リスクと統計的誤差にどのような理論的保証を提供できるか?
  • RQ3データの破損や重尾分布下で、切り捨て損失に基づく学習の性能は、標準的な凸損失手法と比べてどのように異なるか?
  • RQ4提案手法は、ノイズ分布の仮定なしに、浅いおよび深い学習モデルの両方で頑健かつ効果的であるか?
  • RQ5非凸的切り捨て損失関数の下で、SGD は信頼性高く良い解に収束することができ、その収束特性はどのようなものか?

主な発見

  • 本論文は、重尾出力分布下で切り捨て損失を用いた経験的リスク最小化の超過リスクバウンドを確立し、外れ値に対して優れた頑健性を示す。
  • SGD が得る近似停留点の統計的誤差バウンドが導出され、理論的に近似的に最適な解への収束を示す。
  • 外れ値や重尾ノイズを含む破損データを用いた回帰タスクにおいて、提案手法は標準的な凸損失関数を上回る性能を達成する。
  • 浅いおよび深い学習モデルにおける実験により、攻撃的または破損した観測値の存在下でも切り捨て損失の頑健性が確認される。
  • ノイズ分布の事前知識を必要としないため、未知または重尾的ノイズを伴う現実世界のデータに対して汎用的で実用的な解決策である。
  • 理論的および実証的結果が一致し、非凸的切り捨て損失が、学習における標準的な凸損失の代替としての有効性を裏付けている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。