Skip to main content
QUICK REVIEW

[論文レビュー] Mish: A Self Regularized Non-Monotonic Activation Function

Diganta Misra|arXiv (Cornell University)|Aug 23, 2019
Advanced Neural Network Applications参考文献 15被引用数 18
ひとこと要約

この論文は、f(x) = x·tanh(softplus(x)) として定義される自己正則化型で非単調な活性化関数であるMishを紹介しており、深層ニューラルネットワークにおける学習ダイナミクスとモデル性能を向上させている。実験結果では、同じハイパーパrameterとアーキテクチャを用いても、ImageNet-1kにおけるTop-1精度でReLUおよびLeaky ReLUを最大1%上回り、MS-COCOオブジェクト検出ではAP50を2.1%向上させた。

ABSTRACT

We propose $ extit{Mish}$, a novel self-regularized non-monotonic activation function which can be mathematically defined as: $f(x)=x anh(softplus(x))$. As activation functions play a crucial role in the performance and training dynamics in neural networks, we validated experimentally on several well-known benchmarks against the best combinations of architectures and activation functions. We also observe that data augmentation techniques have a favorable effect on benchmarks like ImageNet-1k and MS-COCO across multiple architectures. For example, Mish outperformed Leaky ReLU on YOLOv4 with a CSP-DarkNet-53 backbone on average precision ($AP_{50}^{val}$) by 2.1$\%$ in MS-COCO object detection and ReLU on ResNet-50 on ImageNet-1k in Top-1 accuracy by $\approx$1$\%$ while keeping all other network parameters and hyperparameters constant. Furthermore, we explore the mathematical formulation of Mish in relation with the Swish family of functions and propose an intuitive understanding on how the first derivative behavior may be acting as a regularizer helping the optimization of deep neural networks. Code is publicly available at https://github.com/digantamisra98/Mish.

研究の動機と目的

  • 深層ニューラルネットワークにおける学習ダイナミクスと一般化性能を向上させる活性化関数の開発。
  • ReLU や Leaky ReLU のような単調な活性化関数の限界を解消し、最適化や一般化を阻害する要因を軽減すること。
  • ディープラーニングにおける非単調的で滑らかな活性化関数の数学的および最適化上の利点を調査すること。
  • Mishと併用したデータ拡張の影響を、主なコンピュータビジョンベンチマークで評価すること。
  • Mishの導関数の挙動がどのように正則化として機能するか、理論的および実験的洞察を提供すること。

提案手法

  • Mishをf(x) = x·tanh(softplus(x))として提案し、ReLUとSwishの特性を組み合わせつつ、滑らかさを向上させた。
  • softplus(x) = log(1 + exp(x)) を用い、ReLUの滑らかな近似として、ゼロにおける微分可能性を実現した。
  • 双曲正弦関数を用いて非単調性を導入し、より複雑な特徴表現を可能にした。
  • Mishの1階微分を分析することで、最適化過程における自己正則化効果を説明した。
  • ImageNet-1k および MS-COCO における複数のアーキテクチャ(例:ResNet-50、CSP-DarkNet-53)を用いて性能を検証した。
  • 実験全体にわたり一貫したデータ拡張技術を適用し、Mishとの相乗効果を評価した。

実験結果

リサーチクエスチョン

  • RQ1ImageNet-1k におけるTop-1精度の観点から、MishはReLU や Leaky ReLU と比べてどのように異なるか?
  • RQ2MS-COCO におけるオブジェクト検出で、Mishは平均精度(AP50)をどの程度向上させるか?
  • RQ3Mishの非単調的かつ滑らかな性質が、深層ニューラルネットワークの最適化に果たす役割は何か?
  • RQ4Mishはデータ拡張技術とどのように相互作用し、モデルの一般化性能を向上させるか?
  • RQ5Mishの導関数の挙動は、暗黙の正則化として解釈できるか?

主な発見

  • 同じハイパーパrameterを用いてImageNet-1kで学習したResNet-50において、MishはReLUよりもTop-1精度で1%の向上を達成した。
  • YOLOv4とCSP-DarkNet-53を用いたMS-COCOでは、Leaky ReLUに比べてAP50が2.1%向上した。
  • Mishの非単調的かつ滑らかな性質が、より良い最適化ダイナミクスと一般化性能に寄与している。
  • ImageNet-1k および MS-COCO において、データ拡張技術をMishと組み合わせることで、さらなる性能向上が達成された。
  • Mishの1階微分は、学習の安定化と収束性の向上に寄与する正則化の役割を果たす可能性がある。
  • アーキテクチャやハイパーパrameterの変更なしに、Mishは複数のベンチマークで既存の活性化関数を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。