Skip to main content
QUICK REVIEW

[論文レビュー] Equivalent and Approximate Transformations of Deep Neural Networks

Abhinav Kumar, Thiago Serra|arXiv (Cornell University)|May 27, 2019
Adversarial Robustness in Machine Learning参考文献 55被引用数 11
ひとこと要約

本稿では、常に活性化または非活性な安定したユニット(stable units)を特定・削除し、層を統合することで、深層ReLUネットワークに対する等価的かつ近似可能な変換を提案する。これにより、損失なしの圧縮が可能となる。また、任意のReLUネットワークが2層の浅層ネットワークによってグローバルに近似可能であることを証明し、$l_1$正則化と adversarial training を用いることで線形領域が顕著に削減され、効率的なモデル圧縮と近似が実現可能となる。

ABSTRACT

Two networks are equivalent if they produce the same output for any given input. In this paper, we study the possibility of transforming a deep neural network to another network with a different number of units or layers, which can be either equivalent, a local exact approximation, or a global linear approximation of the original network. On the practical side, we show that certain rectified linear units (ReLUs) can be safely removed from a network if they are always active or inactive for any valid input. If we only need an equivalent network for a smaller domain, then more units can be removed and some layers collapsed. On the theoretical side, we constructively show that for any feed-forward ReLU network, there exists a global linear approximation to a 2-hidden-layer shallow network with a fixed number of units. This result is a balance between the increasing number of units for arbitrary approximation with a single layer and the known upper bound of $\lceil log(n_0+1) ceil +1$ layers for exact representation, where $n_0$ is the input dimension. While the transformed network may require an exponential number of units to capture the activation patterns of the original network, we show that it can be made substantially smaller by only accounting for the patterns that define linear regions. Based on experiments with ReLU networks on the MNIST dataset, we found that $l_1$-regularization and adversarial training reduces the number of linear regions significantly as the number of stable units increases due to weight sparsity. Therefore, we can also intentionally train ReLU networks to allow for effective loss-less compression and approximation.

研究の動機と目的

  • 深層ReLUネットワークが、ユニット数や層数を減らした等価的または近似可能なネットワークに変換可能かどうかを調査すること。
  • ReLUユニットを出力に影響を与えることなく安全に削除または統合できる条件を同定すること。
  • 2つの隠れ層のみを用いた理論的基盤を構築し、深層ネットワークのグローバルな線形近似を実現すること。
  • 正則化と adversarial training が線形領域の数と活性化パターンに与える影響を評価すること。
  • 構造的簡略化に基づく、損失なしの圧縮と効率的な近似による深層ネットワークの圧縮を可能にすること。

提案手法

  • 入力ドメイン全体にわたり常に活性化または非活性な安定したReLUユニットを特定し、安全に削除可能とする。
  • 入力ドメインが制限された場合に限って、局所的な等価性を用いて層を統合し、ユニットを削除する。
  • 活性化パターンに基づき、任意のReLUネットワークに対して2隠れ層の浅層ネットワークを用いてグローバルな線形近似を構築する。
  • 活性化パターンによって線形領域を定義し、関連するパターンにのみ注目することでネットワークサイズを削減する。
  • $l_1$正則化と adversarial training を適用し、重みのスパarsityを誘発し、ユニットを安定化させ、活性化パターンを削減する。
  • MNISTを用いた実験的評価を通じて、さまざまなアーキテクチャと正則化手法を用い、活性化パターンと収束性を測定する。

実験結果

リサーチクエスチョン

  • RQ1安定したユニットを削除することで、ユニット数や層数を減らした等価なReLUネットワークに変換可能か?
  • RQ2局所的等価性は、層の統合とさらなるネットワーク簡略化をどの程度可能にするか?
  • RQ3任意の深層ReLUネットワークが、2層の浅層ネットワークによってグローバルに近似可能であるという理論的保証はあるか?
  • RQ4$l_1$正則化と adversarial training は、線形領域の数と活性化パターンにどのように影響を与えるか?
  • RQ5活性化パターンに基づく構造的簡略化は、効果的かつ損失なしの深層ネットワークの圧縮を可能にするか?

主な発見

  • 5,5,5,5アーキテクチャにおいて、vanillaモデルでは105,480の活性化パターンであったのに対し、$l_2$正則化では1,121、$l_1$正則化でも1,121にまで減少し、正則化による顕著な削減が確認された。
  • l_1正則化を施した adversarial training を適用した5,5,5,5ネットワークでは、活性化パターンが354にまで減少し、比較対象の手法の中で最も少ない数となった。
  • より深いアーキテクチャ(例:8,8,8,8,8,8)においても、l_1正則化を施した adversarial training により、活性化パターンは200,000を超えるものから8,157にまで削減され、強力な圧縮可能性が示された。
  • l_1正則化と adversarial training を用いて学習したモデルは、線形領域を顕著に削減しながらも、検証精度が最大93.92%まで向上した。
  • 理論的分析により、任意のReLUネットワークが2隠れ層の浅層ネットワークによってグローバルに近似可能であることが確認され、深さと幅のバランスが取れることが示された。
  • 常に活性化または非活性な安定したユニットは、出力に影響を与えることなく削除可能であり、入力ドメインが制限された場合には損失なしの圧縮が可能となる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。