Skip to main content
QUICK REVIEW

[論文レビュー] Improving Deep Neural Network with Multiple Parametric Exponential Linear Units

Yang Li, Chunxiao Fan|arXiv (Cornell University)|Jun 1, 2016
Advanced Neural Network Applications参考文献 34被引用数 11
ひとこと要約

本論文では、ReLU、PReLU、ELUを一般化するための学習可能なパラメータαとβを導入することで、負の領域における線形および非線形表現を統合する、新たな活性化関数であるMultiple Parametric Exponential Linear Units (MPELU)を提案する。MPELUは、収束を高速化し一般化性能を向上させ、特にバッチ正規化と新しい重み初期化手法と組み合わせることで、深層残差ネットワークを用いてCIFAR-10(3.57%の誤差)およびCIFAR-100(18.81%の誤差)で最先端の結果を達成する。

ABSTRACT

Activation function is crucial to the recent successes of deep neural networks. In this paper, we first propose a new activation function, Multiple Parametric Exponential Linear Units (MPELU), aiming to generalize and unify the rectified and exponential linear units. As the generalized form, MPELU shares the advantages of Parametric Rectified Linear Unit (PReLU) and Exponential Linear Unit (ELU), leading to better classification performance and convergence property. In addition, weight initialization is very important to train very deep networks. The existing methods laid a solid foundation for networks using rectified linear units but not for exponential linear units. This paper complements the current theory and extends it to the wider range. Specifically, we put forward a way of initialization, enabling training of very deep networks using exponential linear units. Experiments demonstrate that the proposed initialization not only helps the training process but leads to better generalization performance. Finally, utilizing the proposed activation function and initialization, we present a deep MPELU residual architecture that achieves state-of-the-art performance on the CIFAR-10/100 datasets. The code is available at https://github.com/Coldmooon/Code-for-MPELU.

研究の動機と目的

  • 整流線形関数と指数線形関数の間の表現的ギャップを埋めるために、両者の能力を統合する1つの活性化関数を設計すること。
  • 指数線形関数を用いた非常に深いネットワークの有効なトレーニングを可能にするために、新しい重み初期化手法を提案すること。
  • PReLUとELUの利点を統合する学習可能で適応的な活性化関数を通じて、深層ネットワークの一般化性能と収束性を向上させること。
  • MPELUが標準的なELUとは異なり、バッチ正規化と効果的に連携できることを示すことにより、残差アーキテクチャにおける性能向上を実現すること。

提案手法

  • ELUの一般化としてMPELUを提案し、MPELU(x) = α * (e^(β*x) - 1)(x < 0のとき)およびMPELU(x) = x(x ≥ 0のとき)で定義する。学習可能なパラメータとしてαとβを導入する。
  • 指数線形関数に特化した新しい重み初期化手法を提案し、非常に深いネットワークにおけるトレーニングの安定性を保証する解析的解を提供する。
  • パラメータの増加を最小限に抑えるために、チャネル単位またはチャネル共有の初期化をαとβに適用する。
  • バッチ正規化を活用してトレーニングダイナミクスを向上させるために、MPELUを残差ネットワークアーキテクチャ(MPELU ResNet)に統合する。
  • バックプロパゲーション中に、ネットワーク重みとMPELUのパラメータαとβを同時に最適化するために確率的勾配降下法を用いる。
  • 特にCIFAR-10/100において一般化性能を向上させるために、データオーグメンテーションと積極的なトレーニング戦略を適用する。

実験結果

リサーチクエスチョン

  • RQ1ReLU/PReLUとELUの間の表現的ギャップを埋める統合的活性化関数を設計することは可能か?
  • RQ2ELUに学習可能なパラメータαとβを導入することで、深層ネットワークにおける収束性と分類精度が向上するか?
  • RQ3新しい重み初期化手法により、指数線形関数を用いた非常に深いネットワークの安定したトレーニングが可能になるか?
  • RQ4バッチ正規化と組み合わせた場合、MPELUはELUよりも優れた性能を示すか?その理由は何か?
  • RQ5MPELUを用いた残差ネットワークは、CIFAR-10およびCIFAR-100で最先端の性能を達成できるか?

主な発見

  • 1001層のResNetを用いた場合、MPELU活性化関数はCIFAR-10で3.57%のテスト誤差、CIFAR-100で18.81%のテスト誤差を達成し、元のPre-ResNetを上回る性能を示した。
  • 提案された重み初期化手法により、従来の不適切な初期化の問題により困難であった、指数線形関数を用いた非常に深いネットワークの安定したトレーニングが可能になった。
  • MPELUネットワークは、PReLUやELUネットワークと比較して収束が早く、一般化性能も優れている。特にバッチ正規化と組み合わせた場合に顕著である。
  • 実験の結果、バッチ正規化はELUベースのネットワークには悪影響を及ぼすが、MPELUベースのネットワークには向上効果を示すことが判明し、MPELUのアーキテクチャ設計がこの問題を緩和していることが示唆された。
  • 学習可能なパラメータαとβの導入により、モデルの表現能力が向上したが、追加パラメータ数が極めて少ないため、過学習のリスクは顕著に増加しなかった。
  • MPELU ResNetアーキテクチャは、CIFAR-10およびCIFAR-100の両方で最先端の性能を達成し、提案された活性化関数と初期化手法の有効性を実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。