Skip to main content
QUICK REVIEW

[論文レビュー] Lower bounds over Boolean inputs for deep neural networks with ReLU gates

Anirbit Mukherjee, Amitabh Basu|arXiv (Cornell University)|Nov 8, 2017
Stochastic Gradient Optimization Techniques被引用数 9
ひとこと要約

この論文は、ランダム制限とサインランク法を用いて、ブール関数を計算する深層ReLUニューラルネットワークのサイズに関する新たな下界を確立する。LTF-of-ReLU回路について、1/2+εの入力でアンドレエフ関数を計算する場合、ほぼ線形のΩ(ε²⁽¹⁻δ⁾n¹⁻δ)のサイズ下界を示し、深さO(n^ξ)(ξ<1/8)のReLU回路に対して、下層の重み制約のもとで次元に関して指数的下界を導出する。

ABSTRACT

Motivated by the resurgence of neural networks in being able to solve complex learning tasks we undertake a study of high depth networks using ReLU gates which implement the function $x \\mapsto \\max\\{0,x\\}$. We try to understand the role of depth in such neural networks by showing size lowerbounds against such network architectures in parameter regimes hitherto unexplored. In particular we show the following two main results about neural nets computing Boolean functions of input dimension $n$, 1. We use the method of random restrictions to show almost linear, $\\Omega(\\epsilon^{2(1-\\delta)}n^{1-\\delta})$, lower bound for completely weight unrestricted LTF-of-ReLU circuits to match the Andreev function on at least $\\frac{1}{2} +\\epsilon$ fraction of the inputs for $\\epsilon &gt; \\sqrt{2\\frac{\\log^{\\frac {2}{2-\\delta}}(n)}{n}}$ for any $\\delta \\in (0,\\frac 1 2)$ 2. We use the method of sign-rank to show exponential in dimension lower bounds for ReLU circuits ending in a LTF gate and of depths upto $O(n^{\\xi})$ with $\\xi &lt; \\frac{1}{8}$ with some restrictions on the weights in the bottom most layer. All other weights in these circuits are kept unrestricted. This in turns also implies the same lowerbounds for LTF circuits with the same architecture and the same weight restrictions on their bottom most layer. Along the way we also show that there exists a $\\mathbb{R}^ n\ ightarrow \\mathbb{R}$ Sum-of-ReLU-of-ReLU function which Sum-of-ReLU neural nets can never represent no matter how large they are allowed to be.

研究の動機と目的

  • ブール関数を計算する回路のサイズ下界を確立することで、深層ReLUニューラルネットワークにおける深さの役割を理解すること。
  • 従来の回路複雑度理論で未解決であった、ReLUベースの回路のパrameter領域を探索すること。
  • 特に表現能力の観点から、ブール入力に制限されたReLUネットワークの限界を調査すること。
  • 任意の有限サイズのSum-of-ReLUネットワークでは表現できない、Sum-of-ReLU-of-ReLU関数が存在することを示すこと。
  • 既知の下界技術(ランダム制限とサインランク)を、ブール入力を持つReLUネットワークに拡張すること。

提案手法

  • ランダム入力制限の下でLTF-of-ReLU回路のロバストネスを分析し、ほぼ線形のサイズ下界を導出する。
  • サインランク法を用いて、LTFゲートで終了するReLU回路について、深さがO(n^ξ)(ξ<1/8)の範囲で次元に関して指数的下界を導出する。
  • 各層の出力を連続する行および列のパーティションに基づくブロック定数行列として表現する、行列ベースのReLU回路表現を用いる。
  • 回路の深さに関する帰納的議論を適用し、下層からのブロック定数行列の和が、幅と重みパramータの積によって制御される、より精緻なブロック構造を持つ行列を生成することを示す。
  • w個の行列の和は、それぞれD個のブロックを持つ場合、O(w(D−1)+1)個の連続ブロックを持つ行列になるという、鍵となる主張を導入し、回路複雑度の帰納的制御を可能にする。
  • ReLUゲートをmax{0, b + ⟨w,x⟩}としてモデル化し、ReLUの区分線形性を活用して、回路出力を下層出力の線形結合のmax操作として表現する。

実験結果

リサーチクエスチョン

  • RQ11/2+εの入力でアンドレエフ関数を定数の優位性で計算できるLTF出力ゲートを持つ深層ReLUネットワークの最小サイズは何か?
  • RQ2ブール入力に制限され、下層の重みに制約がある場合、深さが有界なReLUネットワークに対して、指数的サイズ下界を確立できるか?
  • RQ3Sum-of-ReLU-of-ReLUとして計算可能な関数のうち、任意の有限サイズのSum-of-ReLUネットワークでも表現できない関数は存在するか?
  • RQ4入力がブールハイパーキューブに制限された場合、ランダム制限やサインランクといった古典的手法がReLUネットワークにどのように適用できるか?
  • RQ5深さと重み制約が、ブール関数を計算する際のReLUネットワークの表現力に与える影響は何か?

主な発見

  • アンドレエフ関数を1/2+ε以上の入力で計算するLTF-of-ReLU回路について、ε > √(2 log²⁽²−δ⁾(n)/n) を満たす任意のδ∈(0,1/2)の下で、ほぼ線形のΩ(ε²⁽¹−δ⁾n¹−δ)のサイズ下界が確立された。
  • サインランク法を用いて、下層にやや厳しい重み制約がある場合、深さO(n^ξ)(ξ<1/8)のReLU回路について、次元に関して指数的下界が証明された。
  • 同じ指数的下界が、同一のアーキテクチャと重み制約を持つLTF回路に対しても成り立つことが示され、しきい値ゲートネットワークへの結果の拡張がなされた。
  • 任意の有限サイズのSum-of-ReLUニューラルネットワークでも表現できない、実数から実数への関数f: ℝⁿ → ℝ(Sum-of-ReLU-of-ReLUの形)が存在することが証明された。
  • 帰納的行列ブロック構造の議論により、k層のReLU回路の出力行列における連続ブロック数が、O((∏ᵢ₌₁ᵏ wᵢ)(mW))のオーダーで増加することが示された。ここでwᵢは層の幅、Wは重みの絶対値の上限を表す。
  • すべての層(下層を除く)に重み制限がない場合でも、特定のブール関数を計算する際、深さと重み制約があるとReLUネットワークは強い制限を受けることが分析で確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。