Skip to main content
QUICK REVIEW

[論文レビュー] Learning Compact Neural Networks Using Ordinary Differential Equations as Activation Functions

MohamadAli Torkamani, Phillip Wallis|arXiv (Cornell University)|May 19, 2019
Model Reduction and Neural Networks参考文献 15被引用数 5
ひとこと要約

本稿では、各ニューロンが学習可能な2階常微分方程式(ODE)を解くことで、個別に最適化された非線形活性化関数を学習する微分方程式ユニット(DEU)を提案する。1ニューロンあたり5つのパラメータ(係数および初期条件)を学習することで、固定活性化関数(例:ReLU)を用いる大規模モデルと同等またはそれを上回る性能を達成しつつ、パラメータ数を削減し、CIFAR-10で1%以上の精度向上を達成する。

ABSTRACT

Most deep neural networks use simple, fixed activation functions, such as sigmoids or rectified linear units, regardless of domain or network structure. We introduce differential equation units (DEUs), an improvement to modern neural networks, which enables each neuron to learn a particular nonlinear activation function from a family of solutions to an ordinary differential equation. Specifically, each neuron may change its functional form during training based on the behavior of the other parts of the network. We show that using neurons with DEU activation functions results in a more compact network capable of achieving comparable, if not superior, performance when is compared to much larger networks.

研究の動機と目的

  • モバイル端末やウェアラブルデバイスなどリソース制限のある環境における大規模ディープニューラルネットワークの計算およびメモリ非効率性を解消すること。
  • 固定活性化関数(例:ReLU、シグモイド)の制限を克服し、ネットワーク構造やデータ分布に適応できない点を改善すること。
  • 各ニューロンが、ODEの解から成る豊富な関数族から、自身の非線形活性化関数を動的に学習可能とすることで、モデルサイズを増大させずに表現能力を向上させること。
  • モデルサイズを小さく保ちながら性能を維持または向上させる、トレーニング可能でパラメータ効率の良い活性化関数学習メカニズムを構築すること。

提案手法

  • 各ニューロンの活性化は、2階線形ODEの解から導出される:$ a y''(t) + b y'(t) + c y(t) = u(t) $、ここで $ u(t) $ はヘヴィサイドのステップ関数である。
  • 勾配逆伝播法により最適化される5つの学習可能パラメータ($ a, b, c, c_1, c_2 $)を用いて、トレーニング中に活性化関数を適応的に変更する。
  • 特異的サブスペース(例:$ a=0 $、$ b=0 $、または $ c=0 $)は明示的な射影により処理され、数値的不安定性を回避するとともに微分可能な挙動を保証する。
  • 正則化戦略として、$ b^2 - 4ac $ を $ \sqrt{4ac} $ に近づけることで、解の指数的発散を防ぐ。
  • 勾配爆発の防止とトレーニングの安定化のため、バッチ正則化と、ネットワークパラメータおよびDEUパラメータの別々の学習率を用いる。
  • 解は記号計算(Maple)を用いて事前計算され、GPU並列推論用に最適化されたコードにコンパイルされる。

実験結果

リサーチクエスチョン

  • RQ1各ニューロンが自身の活性化関数を学習可能とすることで、パラメータ数を減らしても高い性能を達成できるか?
  • RQ2動的でODEベースの活性化関数を学習することで、固定活性化関数と比較して一般化性能とコンパクトネスが向上するか?
  • RQ32階ODEの解空間は、標準的な活性化関数を置き換えられる十分な表現力を持つと同時に、トレーニング可能で安定的か?
  • RQ4異なるアーキテクチャにおいて、DEUの性能はReLU、PReLU、Swishと比較して、精度およびモデルサイズの点で優れているか?

主な発見

  • ResNet-18を用いたCIFAR-10では、DEUはReLU、PReLU、Swishと比較して1%以上の高い精度を達成し、アーキテクチャの変更なしに優れた性能を示した。
  • DEUは、ブロック数を半分にした制限付きResNet-18と本物のResNet-18との性能差を顕著に縮小し、コンパクトなネットワーク設計における高い効率性を示した。
  • MNISTおよびFashion-MNISTでは、DEUベースのネットワークが、標準的なReLUネットワークと同等またはそれ以上の精度を達成しながら、顕著に少ないパラメータ数を用いた。
  • 本手法により、ニューロンが学習したODEパラメータに応じて、周期的、指数的、または放物型の多様な関数形を動的に採用可能となり、表現能力が向上した。
  • トレーニングプロセスは、近似的にゼロに近い係数をゼロに射影し、臨界的でない判別式に近づけることで、特異的サブスペースを効果的に回避し、最適化の堅牢性を確保した。
  • 別々の学習率とバッチ正則化の使用により、極めて非線形な活性化関数であっても、勾配爆発を効果的に防止し、トレーニングの安定化を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。