Skip to main content
QUICK REVIEW

[論文レビュー] Measuring Model Complexity of Neural Networks with Curve Activation Functions

Xia Hu, Weiqing Liu|arXiv (Cornell University)|Jun 16, 2020
Adversarial Robustness in Machine Learning参考文献 35被引用数 4
ひとこと要約

本稿では、曲線活性化関数を備えた深層ニューラルネットワークの複雑さを測るための複雑さ尺度を提案する。この尺度は、線形領域の数を最小限に抑えつつ近似精度を維持する、LANNと呼ばれる区分線形近似フレームワークを導入することで実現される。この手法により、モデルの複雑さの上昇と過学習の間には強い正の相関が示され、その結果、非線形領域を抑制するニューロンプルーニングや、カスタマイズされたL1正則化といった効果的な正則化戦略が得られる。

ABSTRACT

It is fundamental to measure model complexity of deep neural networks. The existing literature on model complexity mainly focuses on neural networks with piecewise linear activation functions. Model complexity of neural networks with general curve activation functions remains an open problem. To tackle the challenge, in this paper, we first propose the linear approximation neural network (LANN for short), a piecewise linear framework to approximate a given deep model with curve activation function. LANN constructs individual piecewise linear approximation for the activation function of each neuron, and minimizes the number of linear regions to satisfy a required approximation degree. Then, we analyze the upper bound of the number of linear regions formed by LANNs, and derive the complexity measure based on the upper bound. To examine the usefulness of the complexity measure, we experimentally explore the training process of neural networks and detect overfitting. Our results demonstrate that the occurrence of overfitting is positively correlated with the increase of model complexity during training. We find that the $L^1$ and $L^2$ regularizations suppress the increase of model complexity. Finally, we propose two approaches to prevent overfitting by directly constraining model complexity, namely neuron pruning and customized $L^1$ regularization.

研究の動機と目的

  • シグモイドやタンジェントなどの曲線活性化関数を有する深層ニューラルネットワークにおけるモデル複雑さの測定という未解決問題に取り組むこと。
  • 曲線活性化関数を有するモデルを正確に表現しつつ、線形領域の数を最小限に抑える区分線形近似フレームワークを構築すること。
  • 近似における線形領域の数の上界に基づく複雑さ尺度を確立し、モデルの非線形性の分析を可能にすること。
  • 訓練過程におけるモデル複雑さの上昇と過学習の関連を実験的に検証すること。
  • 一般化性能の向上を目的とした、直接的な複雑さ制御手法—ニューロンプルーニングとカスタマイズL1正則化—を提案・評価すること。

提案手法

  • 各ニューロンの曲線活性化関数を区分線形関数で近似するフレームワーク「線形近似ニューラルネットワーク(LANN)」を導入する。
  • ユーザーが定義した近似誤差の閾値を満たしつつ、線形領域の数を最小化するように近似を最適化する。
  • LANNが形成する線形領域の数の上界を導出し、これをモデルの複雑さの尺度とする。
  • この複雑さ尺度を用いて訓練のダイナミクスを分析し、複雑さの増大と過学習の相関関係を検証する。
  • 活性化関数の微分の期待絶対値に基づくニューロンプルーニングを提案し、非線形領域の増大を抑制する。
  • 各ニューロンの重みペナルティが、その活性化関数の微分の期待絶対値に比例するようにカスタマイズされたL1正則化を設計する。

実験結果

リサーチクエスチョン

  • RQ1既存の手法が区分線形活性化関数に限定されている中で、曲線活性化関数を有する深層ニューラルネットワークにおけるモデル複雑さをどのように意味的に測定できるか。
  • RQ2訓練過程においてモデル複雑さはどの程度増大するのか。また、その増大は過学習と相関しているか。
  • RQ3L1およびL2正則化は、提案された指標で測定したモデル複雑さの増大を効果的に抑制できるか。
  • RQ4ニューロンプルーニングおよびカスタマイズL1正則化による直接的な複雑さ制御は、モデル性能を維持しつつ過学習を防げるか。

主な発見

  • LANN近似における線形領域の数の上界に基づく提案された複雑さ尺度は、曲線活性化関数を有するモデルの非線形性を効果的に捉えている。
  • CIFARおよびMOONデータセットを用いた実験で、訓練過程におけるモデル複雑さの上昇と過学習の発生との間には強い正の相関が確認された。
  • L1およびL2正則化は、モデル複雑さの上昇を抑制することが分かった。特にL1正則化はより顕著な効果を示した。
  • 活性化関数の微分の期待絶対値に基づくニューロンプルーニングは、複雑さの増大を効果的に制限し、過学習を防止しつつ、性能の低下を最小限に抑えた。
  • 活性化関数の分布がより線形に近いニューロンに高いペナルティを課すカスタマイズL1正則化は、特に高いペナルティ設定下で標準L1正則化を上回った。
  • MOONデータセットでは、ニューロンプルーニング(PR)およびカスタマイズL1(C-L1)で訓練されたモデルの複雑さ尺度はそれぞれ25.02および25.11であった。線形領域の数は25.02と25.11であった。標準L1(382領域)およびL2(545領域)と比較して顕著に低く抑えられ、高い性能を維持していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。