Skip to main content
QUICK REVIEW

[論文レビュー] Neural Networks with Smooth Adaptive Activation Functions for Regression

Le Hou, Dimitris Samaras|arXiv (Cornell University)|Aug 23, 2016
Neural Networks and Applications参考文献 25被引用数 14
ひとこと要約

本稿では、回帰タスクにおける前向き型ニューラルネットワーク向けに、スムーズで適応可能な活性化関数(SAAFs)を提案する。SAAFsは、パラメータ正則化によるリプシッツ連続性を保証することで、柔軟な関数近似を可能にするとともに、モデルの複雑さを制限し、過学習を低減する。本手法は、顔の魅力評価や核の円形度推定を含む、多数の回帰ベンチマークで最先端の性能を達成した。

ABSTRACT

In Neural Networks (NN), Adaptive Activation Functions (AAF) have parameters that control the shapes of activation functions. These parameters are trained along with other parameters in the NN. AAFs have improved performance of Neural Networks (NN) in multiple classification tasks. In this paper, we propose and apply AAFs on feedforward NNs for regression tasks. We argue that applying AAFs in the regression (second-to-last) layer of a NN can significantly decrease the bias of the regression NN. However, using existing AAFs may lead to overfitting. To address this problem, we propose a Smooth Adaptive Activation Function (SAAF) with piecewise polynomial form which can approximate any continuous function to arbitrary degree of error. NNs with SAAFs can avoid overfitting by simply regularizing the parameters. In particular, an NN with SAAFs is Lipschitz continuous given a bounded magnitude of the NN parameters. We prove an upper-bound for model complexity in terms of fat-shattering dimension for any Lipschitz continuous regression model. Thus, regularizing the parameters in NNs with SAAFs avoids overfitting. We empirically evaluated NNs with SAAFs and achieved state-of-the-art results on multiple regression datasets.

研究の動機と目的

  • 回帰ニューラルネットワークのモデルバイアスを、特に2番目に最後の層に適応可能な活性化関数(AAF)を適用することで低減すること。
  • 既存のAAFに共通する過学習問題に対処するため、複雑さが有界な滑らかなパラメータ化された活性化関数を導入すること。
  • パラメータ正則化の下でSAAFsがリプシッツ連続なモデルをもたらすことを証明することで、回帰タスクにおける一般化を保証すること。
  • 多様な回帰データセットにおいて、固定および非適応的活性化関数と比較してSAAFsの優位性を実証的に検証すること。

提案手法

  • 任意の連続関数を任意の精度で近似可能な、分(piecewise)多項式形のスムーズな適応的活性化関数(SAAF)を提案する。
  • SAAFsを基底関数の線形結合として定義し、2階微分がトレーニング可能な重みで制御されることで、形状の適応性を実現する。
  • パrameterの大きさが有界である場合、SAAFに基づくネットワークがリプシッツ連続であることが保証され、モデルの複雑さが有界になる。
  • ファットシャッタリング次元を用いてモデル複雑さの上界を導出し、SAAFパラメータのL2正則化によってこれを最小化する。
  • SAAFsを前向き型ネットワークの最終隠れ層に適用し、タスク固有の活性化形状を学習可能とすることで、回帰性能を向上させる。
  • SAAFパラメータにL2正則化を適用することで滑らかさを制御し、過学習を防止する。リプシッツ性を活用して一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1回帰層に適応可能な活性化関数を適用することで、固定活性化関数と比較してモデルバイアスを顕著に低減できるか?
  • RQ2分(piecewise)多項式構造を持つ滑らかで適応可能な活性化関数は、複雑な回帰関数に対しても高い近似精度を達成できるか?
  • RQ3SAAFsにおけるパラメータ正則化は、回帰タスクにおけるモデル複雑さの制御と過学習防止に効果的か?
  • RQ4多様な回帰データセットにおいて、SAAFsは既存のAAFおよび非適応的活性化関数よりも一般化性能に優れるか?

主な発見

  • LSP人体ポーズ推定データセットにおいて、SAAFc2はRMSE 3.801、相関係数0.745を達成し、すべてのベースライン手法を上回った。
  • 顔の魅力評価データセットでは、SAAFc2がRMSE 3.801、相関係数0.745を達成し、観察者間一致水準に近づいた。
  • 病理画像からの核の円形度推定において、R-SAAFc1はRMSE 0.483、相関係数0.649を達成し、直接セグメンテーションに基づく計算(RMSE 0.609)を顕著に上回った。
  • 理論的分析により、SAAFsはパラメータノルムが有界な条件下でリプシッツ連続なモデルをもたらすことが証明され、ファットシャッタリング次元が有限となり、過学習リスクが低減した。
  • 実験的結果から、SAAFsは2階微分の正則化が効果的であるため、5000個の多項式セグメントとたった21件の訓練データでも良好な一般化性能を示した。
  • SAAFフレームワークは、ポーズ推定、顔の魅力、核の形態予測を含む、すべてのテストされた回帰データセットで一貫して最先端の性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。