Skip to main content
QUICK REVIEW

[論文レビュー] AReLU: Attention-based Rectified Linear Unit

Dengsheng Chen, Jun Li|arXiv (Cornell University)|Jun 24, 2020
Advanced Neural Network Applications参考文献 41被引用数 14
ひとこと要約

本稿では、各層あたり2つの可学習パラメータを用いて、符号に基づくアテンションメカニズムをReLUと統合することで、正の特徴を能動的に強調し、負の特徴を抑制する、学習可能な活性化関数であるAReLUを提案する。AReLUは、訓練の安定性を向上させ、小さな学習率下でも収束を加速し、複数のアーキテクチャにおいて転移学習およびメタラーニングのベンチマークで顕著な性能向上を達成する。

ABSTRACT

Element-wise activation functions play a critical role in deep neural networks via affecting the expressivity power and the learning dynamics. Learning-based activation functions have recently gained increasing attention and success. We propose a new perspective of learnable activation function through formulating them with element-wise attention mechanism. In each network layer, we devise an attention module which learns an element-wise, sign-based attention map for the pre-activation feature map. The attention map scales an element based on its sign. Adding the attention module with a rectified linear unit (ReLU) results in an amplification of positive elements and a suppression of negative ones, both with learned, data-adaptive parameters. We coin the resulting activation function Attention-based Rectified Linear Unit (AReLU). The attention module essentially learns an element-wise residue of the activated part of the input, as ReLU can be viewed as an identity transformation. This makes the network training more resistant to gradient vanishing. The learned attentive activation leads to well-focused activation of relevant regions of a feature map. Through extensive evaluations, we show that AReLU significantly boosts the performance of most mainstream network architectures with only two extra learnable parameters per layer introduced. Notably, AReLU facilitates fast network training under small learning rates, which makes it especially suited in the case of transfer learning and meta learning. Our source code has been released (see https://github.com/densechen/AReLU).

研究の動機と目的

  • 固定された活性化関数の限界、特に勾配消失と最適でない特徴の集中を是正すること。
  • データに適応する可学習な活性化メカニズムを導入することで、訓練のダイナミクスとモデルの表現力の両方を向上させること。
  • 特に転移学習およびメタラーニングに有益な小さな学習率下でも、収束を高速化できること。
  • アテンションに基づく定式化により、従来の可学習活性化関数よりも解釈性が高く、効果的な代替手段を提供すること。

提案手法

  • 各要素の符号に基づくアテンションモジュールを導入し、各特徴マップ要素のスケーリングを学習する。
  • 学習されたアテンションマップをReLUと組み合わせ、微分可能でデータに適応する活性化関数AReLUを構築する。
  • アテンションモジュールは、ReLUの恒等写像からの要素ごとの残差を学習することで、勾配の流れを改善する。
  • 各層あたりたった2つの追加可学習パラメータを用いるため、計算オーバーヘッドを最小限に抑える。
  • 標準的なCNNにおいて複数の層にAReLUを適用し、画像分類、転移学習、メタラーニングのタスクでの性能を評価する。
  • SGDと学習率スケジューリングを用いた標準的な訓練プロトコルを採用し、AReLUを非可学習および他の可学習活性化関数と比較する。

実験結果

リサーチクエスチョン

  • RQ1アテンションに基づくメカニズムは、深層ネットワークにおけるReLUの表現力と訓練ダイナミクスを向上させ得るか?
  • RQ2可学習で符号に基づくアテンションメカニズムは、特に小さな学習率下で収束を高速化するか?
  • RQ3転移学習およびメタラーニングの状況下で、AReLUは既存の可学習活性化関数と比べてどのように差をつけるか?
  • RQ4最小限のパラメータオーバーヘッドで、勾配の流れの改善を伴いながら、AReLUはより優れた性能を達成できるか?

主な発見

  • 20エポックのファインチューニング後、SVHNで78.48%のテスト精度を達成し、転移学習設定で他のすべての活性化関数を上回った。
  • 5-ways-1-shotメタラーニングタスクにおいて、AReLUは92.50%の精度に達し、PReLU(88.13%)およびPAU(43.13%)を顕著に上回り、優れた適応速度を示した。
  • 5-ways-5-shotsのメタラーニングにおいて、AReLUは94.30%の精度を達成し、SELU(93.50%)およびGELU(69.37%)を含むすべてのベースラインを上回った。
  • 小さな学習率(1e-5)下でもAReLUは高速な収束を実現し、ファインチューニングおよびメタラーニングに極めて効果的である。
  • 特徴可視化により、AReLUはタスク指向で焦点を当てた活性化を生成することが確認され、特徴マップ内の関連領域が明確に強調された。
  • 各層あたりたった2つの可学習パラメータを追加するだけで、多様なアーキテクチャおよびベンチマークにおいて一貫して顕著な性能向上が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。