Skip to main content
QUICK REVIEW

[論文レビュー] Flexible Rectified Linear Units for Improving Convolutional Neural Networks

Suo Qiu, Bolun Cai|arXiv (Cornell University)|Jun 25, 2017
Advanced Neural Network Applications参考文献 18被引用数 7
ひとこと要約

本稿では、固定のゼロポイントを学習可能なしきい値に置き換えることで、より高いネットワーク表現力が得られる学習可能な活性化関数であるフレキシブル・リクトフィード・リニア・ユニット(FReLU)を提案する。FReLUは、CIFAR-10、CIFAR-100、ImageNetの各データセットにおいて、プレーンネットワークおよび残差ネットワークの両方で、ReLUよりも高速な収束と高い精度を達成しており、計算コストの増加は最小限に抑えられる。

ABSTRACT

Rectified linear unit (ReLU) is a widely used activation function for deep convolutional neural networks. However, because of the zero-hard rectification, ReLU networks miss the benefits from negative values. In this paper, we propose a novel activation function called \emph{flexible rectified linear unit (FReLU)} to further explore the effects of negative values. By redesigning the rectified point of ReLU as a learnable parameter, FReLU expands the states of the activation output. When the network is successfully trained, FReLU tends to converge to a negative value, which improves the expressiveness and thus the performance. Furthermore, FReLU is designed to be simple and effective without exponential functions to maintain low cost computation. For being able to easily used in various network architectures, FReLU does not rely on strict assumptions by self-adaption. We evaluate FReLU on three standard image classification datasets, including CIFAR-10, CIFAR-100, and ImageNet. Experimental results show that the proposed method achieves fast convergence and higher performances on both plain and residual networks.

研究の動機と目的

  • ReLUの固定ゼロポイントによる整流処理の制限を解消し、負の値を無視することでネットワーク表現力が制限されることを是正する。
  • 深層畳み込みニューラルネットワークにおける特徴表現力とモデル性能の向上に、学習可能な活性化しきい値が寄与するかを検討する。
  • 計算コストを低く保ちつつ、整流点の適応的学習を可能にするシンプルで効率的な活性化関数を設計する。
  • 提案されたFReLUの一般化性と有効性を、多様なネットワークアーキテクチャおよびベンチマークデータセット上で評価する。

提案手法

  • FReLUは、ReLU活性化関数を変更し、負の値がクリッピングされる点を制御する学習可能なパラメータを導入することで、固定ゼロしきい値を置き換える。
  • 活性化関数は、FReLU(x) = max(αx, 0) として定義され、αはバックプロパゲーション中に最適化されるトレーニング可能なスカラー・パラメータである。
  • 学習可能なパラメータαは、トレーニング中にエンド・ツー・エンドで最適化され、ネットワークが最適な整流しきい値を自動的に決定できる。
  • 計算効率を保ち、既存のディープラーニングフレームワークとの互換性を維持するため、指数関数的演算を含まないよう設計されている。
  • 一般化性の評価のため、プレーンネットワークおよび残差ネットワークアーキテクチャに適用されている。
  • トレーニングプロセスは、ネットワーク重みとαパラメータの両方の勾配更新を伴う標準的なバックプロパゲーションを使用している。

実験結果

リサーチクエスチョン

  • RQ1ReLU活性化関数における学習可能なしきい値が、固定ReLUと比較して深層畳み込みニューラルネットワークの性能を向上させるか?
  • RQ2学習可能な整流点により負の値が寄与するようになると、特徴表現力とモデル表現力が向上するか?
  • RQ3標準的な画像分類ベンチマークにおいて、FReLUの収束速度と最終的な精度はどのように評価されるか?
  • RQ4FReLUは、プレーンネットワークおよび残差ネットワークなどの異なるネットワークアーキテクチャにどの程度一般化されるか?
  • RQ5活性化関数に学習可能なパラメータを組み込むことで、顕著な計算コストの増加が生じるか?

主な発見

  • FReLUは、評価されたすべてのデータセットで、標準ReLUと比較してトレーニング中の収束が速いことが確認された。
  • CIFAR-10では、プレーンネットワークおよび残差ネットワークの両方で、FReLUがReLUを上回るトップ-1精度を達成しており、実験で測定可能な性能向上が報告されている。
  • CIFAR-100では、FReLUが一貫した性能向上を示しており、より複雑な分類タスクに対しても頑健であることが示された。
  • ImageNetでは、FReLUがReLUを上回る高い精度を達成しながらも、高速な収束を維持しており、大規模データセットへのスケーラビリティが確認された。
  • FReLUにおける学習済みパラメータαは、トレーニング中に負の値に収束する傾向にあり、ネットワークが負の活性化を活用することで利益を得ていることが示唆された。
  • 指数関数的演算が存在しないため、FReLUは計算コストを低く保っており、リソース制約のある環境でのデプロイに適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。