Skip to main content
QUICK REVIEW

[論文レビュー] Approximation Schemes for ReLU Regression

Ilias Diakonikolas, Surbhi Goel|arXiv (Cornell University)|May 26, 2020
Machine Learning and Algorithms参考文献 27被引用数 8
ひとこと要約

本稿では、等方的対数凹性またはサブガウス分布などの弱い分布的仮定の下で、ReLU回帰に対する最初の効率的な定数要因近似アルゴリズムを提示する。分布的性質を介して強い凸性を誘導する新たな代理損失の特徴付けを導入することで、情報理論的限界に一致する近似的に最良の標本複雑度と誤差境界を達成する多項式時間近似スキーム(PTAS)を実現した。

ABSTRACT

We consider the fundamental problem of ReLU regression, where the goal is to output the best fitting ReLU with respect to square loss given access to draws from some unknown distribution. We give the first efficient, constant-factor approximation algorithm for this problem assuming the underlying distribution satisfies some weak concentration and anti-concentration conditions (and includes, for example, all log-concave distributions). This solves the main open problem of Goel et al., who proved hardness results for any exact algorithm for ReLU regression (up to an additive $ε$). Using more sophisticated techniques, we can improve our results and obtain a polynomial-time approximation scheme for any subgaussian distribution. Given the aforementioned hardness results, these guarantees can not be substantially improved. Our main insight is a new characterization of surrogate losses for nonconvex activations. While prior work had established the existence of convex surrogates for monotone activations, we show that properties of the underlying distribution actually induce strong convexity for the loss, allowing us to relate the global minimum to the activation's Chow parameters.

研究の動機と目的

  • 弱い分布的仮定の下で、ReLU回帰に対する定数要因近似が多項式時間で達成可能かどうかという未解決問題に取り組む。
  • ReLU回帰の非凸性と指数的多数の局所最小値の問題を、分布固有の性質を活用して代理損失の強い凸性を保証することで克服する。
  • 等方的対数凹性分布では O(opt) + ε の誤差、サブガウス分布では (1+η)·opt + ε の誤差を達成するアルゴリズムを設計する。これは既知の下界と一致する。
  • 対数凹性分布の下で、情報理論的に最適な Õ(d/ε²) の標本複雑度を確立する。これは次元 d に対してほぼ線形である。
  • 分布的制約下で、グローバル最小値と活性化固有のチョウパラメータとの関係を示すことで、非凸設定における代理損失設計の理論的基盤を提供する。

提案手法

  • 分布的性質(例:対数凹性、サブガウス性)を活用して強い凸性を誘導する、代理損失の新しい特徴付けを導入し、グローバル収束の保証を可能にする。
  • 対数凹性分布上での一様片側集中を用いて推定誤差を抑え、標本効率性を保証する。
  • サブガウス仮定下でのReLU損失の尾部挙動を制御するために、高度な反集中不等式と集中不等式を適用する。
  • ReLU関数の多項式近似と低次多項式上での経験的リスク最小化を組み合わせることで、多項式時間近似スキーム(PTAS)を構築する。
  • 代理損失のグローバル最小値とReLU活性化のチョウパラメータとの間の関係を活用し、近似品質を保証する。
  • 二段階アプローチを採用する:まず、有界ノイズ下で等方的回帰に類似した技術を用いて条件付き平均関数を近似する。次に、多項式近似と経験的リスク最小化を用いて推定値を精緻化する。

実験結果

リサーチクエスチョン

  • RQ1等方的対数凹性またはサブガウス分布の下で、ReLU回帰に対する定数要因近似が多項式時間で達成可能か?
  • RQ2対数凹性やサブガウス性といった分布的性質は、非凸ReLU回帰における代理損失の強い凸性をどの程度可能にするか?
  • RQ3次元 d に対してほぼ線形な標本複雑度を達成しつつ、誤差が O(opt) + ε 以内であるアルゴリズムを設計可能か?
  • RQ4より強いサブガウス仮定の下で、任意の定数 η > 0 に対して近似保証を (1+η)·opt + ε に改善可能か?
  • RQ5分布的制約下で、ReLU活性化のチョウパラメータは、代理損失のグローバル最小値とどのように関係するか?

主な発見

  • 等方的対数凹性分布の下では、O(opt) + ε の誤差を Õ(d/ε²) の標本数と Õ(d²/ε²) の実行時間で達成し、情報理論的標本複雑度の対数要因を除いて最適である。
  • ν-サブガウス分布の下では、任意の定数 η > 0 に対して、標本および実行時間複雑度が O((1/ε²)·(d/(η³ν²))^(1/η³)) であるPTASが達成され、(1+η)·opt + ε の誤差を実現する。
  • 本稿で提案するアルゴリズムは、弱い分布的仮定の下で、ReLU回帰に対する定数要因近似を多項式時間で達成する最初のものである。
  • 誤差境界は、既知の難易度結果により本質的にタイトである:一般の分布では、O(opt) + ε よりも良い結果は達成不可能である。
  • 解析から、分布的性質(例:反集中)が代理損失における強い凸性を誘導し、非凸性にもかかわらずグローバル収束を可能にすることが明らかになった。
  • 本手法は、代理損失のグローバル最小値とReLU活性化のチョウパラメータとの間の新しい関係を確立し、近似品質に関する理論的保証を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。