Skip to main content
QUICK REVIEW

[論文レビュー] TanhExp: A Smooth Activation Function with High Convergence Speed for Lightweight Neural Networks

Xinyu Liu, Xiaoguang Di|arXiv (Cornell University)|Mar 22, 2020
Advanced Neural Network Applications参考文献 18被引用数 6
ひとこと要約

本稿では、$ f(x) = x \tanh(e^x) $ として定義される滑らかで非区分的な活性化関数、TanhExp を提案する。この関数はパrameterを追加せずに、軽量ニューラルネットワークにおける収束速度と精度を向上させる。MNIST、Fashion-MNIST、CIFAR-10、CIFAR-100 において、ReLU、Mish、Swish よりも高速な学習と優れた性能を達成しており、CIFAR-100 の LeNet においては Mish よりも最大6.5%高いテスト精度を記録した。

ABSTRACT

Lightweight or mobile neural networks used for real-time computer vision tasks contain fewer parameters than normal networks, which lead to a constrained performance. In this work, we proposed a novel activation function named Tanh Exponential Activation Function (TanhExp) which can improve the performance for these networks on image classification task significantly. The definition of TanhExp is f(x) = xtanh(e^x). We demonstrate the simplicity, efficiency, and robustness of TanhExp on various datasets and network models and TanhExp outperforms its counterparts in both convergence speed and accuracy. Its behaviour also remains stable even with noise added and dataset altered. We show that without increasing the size of the network, the capacity of lightweight neural networks can be enhanced by TanhExp with only a few training epochs and no extra parameters added.

研究の動機と目的

  • モデルサイズと学習時間の制約による軽量ニューラルネットワークの性能制限を解消すること。
  • モバイルおよびリアルタイムビジョン応用における ReLU の欠点(非ゼロ平均の活性化、死んだ ReLU 問題)を克服すること。
  • モデルの複雑さを増さずに収束速度と精度を向上させる、単純で効率的かつ頑健な活性化関数を設計すること。
  • TanhExp が追加パrameterなしにネットワークの表現能力を向上させ、小さなデータセットにおいてより速い収束とより良い一般化を実現できることを示すこと。

提案手法

  • 滑らかさと近似的な線形性を併せ持つ、$ f(x) = x \cdot \tanh(e^x) $ として定義される新しい活性化関数、TanhExp を提案する。
  • 関数が至る所で連続的かつ微分可能であり、負の値を有することで活性化の平均をゼロに近づけ、学習を加速させることを保証する。
  • 双曲正接関数内の指数関数を活用して、硬い切り捨てを避ける滑らかな遷移を実現し、死んだ ReLU 問題を緩和する。
  • 計算効率を考慮し、ReLU よりわずかに計算コストが高く、Swish と同等のコストでありながら、Mish よりも複雑な関数よりも優れた性能を発揮する。
  • 固定されたハイパーパrameterを用いて、LeNet や ResNet-20、ResNet-32 などのさまざまな軽量アーキテクチャで TanhExp を実装し、複数のデータセットで評価する。
  • 標準指標(テスト精度、収束速度、ノイズ耐性、計算時間)を用いて性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1パラメータ数を増やさずに、モデルサイズを維持したまま、滑らかで非区分的な活性化関数が軽量ニューラルネットワークの収束速度と精度を向上させられるか?
  • RQ2TanhExp は、学習速度、最終的な精度、およびデータの摂動下での耐性という観点から、ReLU、Mish、Swish と比べてどのように差をつけるか?
  • RQ3TanhExp は、MNIST、Fashion-MNIST、CIFAR-10、CIFAR-100 といった多様なデータセットにおいて、特に浅い構造や小さなアーキテクチャでも高い性能を維持できるか?
  • RQ4TanhExp は、リアルタイムのモバイルおよび組み込みビジョンシステムに実用的であるほど計算効率が良いか?
  • RQ5TanhExp は、勾配の流れの改善と活性化の平均のゼロ中心化により、軽量ネットワークの表現能力を向上させられるか?

主な発見

  • 15層のネットワークを用いた MNIST では、TanhExp は1エポック目で89.86%のテスト精度を達成し、Swish(40.30%)や Mish(65.68%)を大きく上回った。
  • CIFAR-100 では、TanhExp は ReLU より5%高いテスト精度、Mish より6.5%高い、LeNet においては Swish より4.7%高い精度を記録した。
  • TanhExp はすべてのベースラインより収束が速く、同等またはより高い精度に到達するための訓練エポック数が少なかった。
  • ノイズやデータセットのシフトに対しても安定した性能を維持し、優れた耐性を示した。
  • 計算コストでは、Mish より約2倍速く、Swish と同等の速度であった。収束が速いため、ReLU よりも総合的な訓練時間が著しく短縮された。
  • 収束速度が速く、1ステップあたりの計算量も少ないことから、TanhExp はすべての比較対象活性化関数(ReLU を含む)よりも優れた精度-速度トレードオフを達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。