QUICK REVIEW
[論文レビュー] On the Learnability of Deep Random Networks
Abhimanyu Das, Sreenivas Gollapudi|arXiv (Cornell University)|Apr 8, 2019
Domain Adaptation and Few-Shot Learning参考文献 21被引用数 5
ひとこと要約
この論文は、ランダム重みと符号活性化関数を用いた深層ランダムニューラルネットワークの学習可能性を調査し、理論的に深さが増すにつれて学習可能性が指数関数的に低下することを示している。これは、入力ベクトルが層を経て次第に直交的になることに起因する。実験的検証により、最先端の訓練手法を用いても、この学習可能性の低下が確認され、深層ランダムアーキテクチャの学習には根本的な制限があることが示唆される。深さが対数的を超えると、その制限は顕著になる。
ABSTRACT
In this paper we study the learnability of deep random networks from both theoretical and practical points of view. On the theoretical front, we show that the learnability of random deep networks with sign activation drops exponentially with its depth. On the practical front, we find that the learnability drops sharply with depth even with the state-of-the-art training methods, suggesting that our stylized theoretical results are closer to reality.
研究の動機と目的
- 深層ランダムニューラルネットワークにおける学習可能性の理論的限界を理解すること。特に、表現可能性と最適化による実際の学習可能性の違いを明確にすること。
- 深さがランダムな深層ネットワークにおける入力ベクトル間の相関に及ぼす影響、特に符号活性化関数下での影響を分析すること。
- 深さが ω(log n) のランダム深層ネットワークが、勾配降下やPCAを含む広範な統計的クエリ(SQ)アルゴリズムによっては効率的に学習できないことを確立すること。
- さまざまな深さのランダムに初期化された深層ネットワークに対して、最先端の深層学習手法を用いて理論的予測を実験的に検証すること。
- 十分に深い深層ランダムネットワークが、ハッシュ関数に類似した性質、例えば高次独立性を示すかどうかを調査すること。
提案手法
- 理論的分析により、独立同一分布のガウス重みと符号活性化関数を用いた深層ランダムネットワークの各層を通過する入力ペア間のコサイン類似度の変化をモデル化する。
- 証明により、非同一方向の入力ペアは次第に互いに遠ざかり、角距離が増大し、数層を経てほぼ直交状態に達することが示される。
- 相関の減少を形式化するために、ガウス確率変数と符号関数の性質を利用した確率的非線形再帰を用いる。
- 統計的クエリ(SQ)モデルにおける下界を適用し、深さが ω(log n) を超えるネットワークはSQアルゴリズムによっては効率的に学習できないことを示す。
- 論文は、深さが ω(log n) のランダムネットワークの出力が n^{1/4}-way 独立であることを導出し、暗号的硬さの可能性を示唆する。
- 実験的評価では、深さを増すランダム初期化された深層教師ネットワークの出力に、学生ネットワークを訓練し、標準的な深層学習技術を用いて学習性能を測定する。
実験結果
リサーチクエスチョン
- RQ1符号活性化関数を用いた深層ランダムネットワークの学習可能性は、深さが増すにつれて指数関数的に低下するか?
- RQ2確率的再帰解析を用いて、入力ペア間の相関の理論的低下を形式的に証明できるか?
- RQ3深さが ω(log n) のランダム深層ネットワークは、統計的クエリアルゴリズムによって実際に証明的に学習不能であるか?
- RQ4実用的な訓練手法が深層ランダムネットワークをどれほどうまく学習できないか。理論的予測を確認するにはどの程度の限界があるか?
- RQ5十分に深い深層ランダムネットワークは、ハッシュ関数に類似した性質、例えば高次独立性を示すか?
主な発見
- 符号活性化関数を用いた深層ランダムネットワークの学習可能性は、深さが増すにつれて指数関数的に低下する。これは、数層を経て入力ペアがほぼ直交状態に達するためである。
- 理論的分析により、深さが ω(log n) の場合、このようなネットワークは勾配降下やPCAを含むあらゆる統計的クエリアルゴリズムによっては効率的に学習できないことが証明された。
- 実験的評価により、深さが増すにつれて学習性能が急激に低下することが確認された。これは、最先端の訓練手法を用いても同様に観察され、理論的境界が実証された。
- 深さが ω(log n) のランダムネットワークの出力が n^{1/4}-way 独立であることが示され、暗号的硬さの可能性への証拠が得られた。
- 線形関数についての一致する学習可能性結果が確立され、非線形ランダム深層ネットワークの非学習可能性と対照的である。
- 理論的および実験的結果から、深さが対数的を超えると、表現可能であっても、ランダム深層ネットワークは根本的に学習が困難になることが示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。