Skip to main content
QUICK REVIEW

[论文解读] The Computational Complexity of Training ReLU(s)

Pasin Manurangsi, Daniel Reichman|arXiv (Cornell University)|Oct 9, 2018
Adversarial Robustness in Machine Learning参考文献 1被引用 21
一句话总结

本文確立了訓練深度為2的ReLU神經網絡的計算複雜度,證明即使在可實現情況下(即理論上可達零訓練誤差),最小化平方誤差仍是NP難問題,即使僅有一個ReLU或兩個ReLU的情況亦然。此外,本文提出了一個有效的正則學習演算法,其時間複雜度為 $2^{(k/\epsilon)^{O(1)}}n^{O(1)}}$,適用於權重與輸入均在單位球內的網絡,延伸了先前的非正則學習結果。

ABSTRACT

We consider the computational complexity of training depth-2 neural networks composed of rectified linear units (ReLUs). We show that, even for the case of a single ReLU, finding a set of weights that minimizes the squared error (even approximately) for a given training set is NP-hard. We also show that for a simple network consisting of two ReLUs, the error minimization problem is NP-hard, even in the realizable case. We complement these hardness results by showing that, when the weights and samples belong to the unit ball, one can (agnostically) properly and reliably learn depth-2 ReLUs with $k$ units and error at most $ε$ in time $2^{(k/ε)^{O(1)}}n^{O(1)}$; this extends upon a previous work of Goel, Kanade, Klivans and Thaler (2017) which provided efficient improper learning algorithms for ReLUs.

研究动机与目标

  • 確定訓練深度為2的ReLU網絡以最小化平方誤差的計算複雜度。
  • 探討在可實現情況下(即理論上可達零訓練誤差)ReLU訓練問題是否依然困難。
  • 在有界範數約束下,設計一個正則且可靠的ReLU網絡學習演算法,以改進先前的非正則學習方法。
  • 建立訓練困難性(NP難)與在特定範數約束下學習可行性之間的分離。
  • 釐清ReLU訓練的NP難度與先前關於閾值單元或平均情況難度結果之間的關係。

提出的方法

  • 透過從已知的NP難問題進行歸約,證明ReLU訓練的NP難度,顯示即使近似最小誤差至接近多項式因子內,亦為NP難。
  • 引入偏置調整技術,將近似最小化器轉換為正則ReLU假設,同時控制誤差,確保輸出仍為有效的ReLU網絡。
  • 利用Lipschitz損失函數(例如 $\ell_{\gamma\text{-cont}}$)建立泛化界,將經驗損失與真實損失關聯,從而獲得可靠的學習保證。
  • 利用平方損失在輸出範圍 $[0, 2k]$ 上為Lipschitz且有界的性質,使泛化定理得以應用,從而界定了泛化誤差。
  • 採用基於樣本的優化策略,先從有限樣本中最小化經驗誤差以獲得假設,再透過偏置調整確保其保持正則ReLU結構。
  • 利用逼近理論與核方法的工具,延續Goel等人 [GKKT17] 的先前工作,設計出時間複雜度為 $2^{(k/\epsilon)^{O(1)}}n^{O(1)}}$ 的學習演算法。

实验结果

研究问题

  • RQ1訓練單一ReLU網絡以最小化平方誤差是否為NP難?
  • RQ2即使訓練數據可實現(即理論上可達零誤差),ReLU訓練問題是否仍為NP難?
  • RQ3能否設計一個適用於有界權重與輸入的ReLU網絡學習演算法,使其在僅依賴於 $k/\epsilon$ 指數時間內達到誤差 $\epsilon$?
  • RQ4ReLU訓練的NP難度與先前關於閾值單元或平均情況假設的難度結果有何關係?
  • RQ5偏置調整是否可用於將非正則解轉換為正則ReLU網絡,同時保持泛化保證?

主要发现

  • 即使僅訓練單一ReLU以最小化平方誤差,其問題亦為NP難,且近似至接近多項式因子內亦為NP難。
  • 對於兩個ReLU,即使在可實現情況下(理論上可達零訓練誤差),誤差最小化問題仍為NP難。
  • 存在一個適用於具有 $k$ 個神經元、且輸入與權重均在單位球內的ReLU網絡的正則學習演算法,其在時間 $2^{(k/\epsilon)^{O(1)}}n^{O(1)}}$ 內可達至多 $\epsilon$ 的誤差。
  • 所提出的演算法可靠且能正確學習ReLU函數,相較於Goel等人 [GKKT17] 的先前非正則學習結果有所改進。
  • 關鍵技術洞察在於,偏置調整可保持泛化能力,同時確保輸出仍為有效的ReLU網絡。
  • 透過使用Lipschitz且有界的損失函數,建立了泛化界,從而可從經驗誤差最小化推導出可靠的誤差保證。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。