Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Networks with Smooth Adaptive Activation Functions for Regression

Le Hou, Dimitris Samaras|arXiv (Cornell University)|2016. 08. 23.
Neural Networks and Applications참고 문헌 25인용 수 14
한 줄 요약

이 논문은 회귀 과제를 위한 피드포워드 신경망을 위한 조각다항식 기반의 적응형 활성화 함수인 스무스 적응형 활성화 함수(SAAFs)를 제안한다. SAAFs는 매개변수 정규화를 통해 리프시츠 연속성을 보장함으로써 모델 복잡도를 제한하고 과적합을 줄이며, 민감한 함수 근사가 가능하다. 이 방법은 얼굴 매력도 예측 및 핵 원형도 추정과 같은 다양한 회귀 벤치마크에서 최고 성능을 기록한다.

ABSTRACT

In Neural Networks (NN), Adaptive Activation Functions (AAF) have parameters that control the shapes of activation functions. These parameters are trained along with other parameters in the NN. AAFs have improved performance of Neural Networks (NN) in multiple classification tasks. In this paper, we propose and apply AAFs on feedforward NNs for regression tasks. We argue that applying AAFs in the regression (second-to-last) layer of a NN can significantly decrease the bias of the regression NN. However, using existing AAFs may lead to overfitting. To address this problem, we propose a Smooth Adaptive Activation Function (SAAF) with piecewise polynomial form which can approximate any continuous function to arbitrary degree of error. NNs with SAAFs can avoid overfitting by simply regularizing the parameters. In particular, an NN with SAAFs is Lipschitz continuous given a bounded magnitude of the NN parameters. We prove an upper-bound for model complexity in terms of fat-shattering dimension for any Lipschitz continuous regression model. Thus, regularizing the parameters in NNs with SAAFs avoids overfitting. We empirically evaluated NNs with SAAFs and achieved state-of-the-art results on multiple regression datasets.

연구 동기 및 목표

  • 두 번째로 마지막 레이어에 특별히 적용된 적응형 활성화 함수(AAFs)를 통해 회귀 신경망의 모델 편향을 줄이기.
  • 모델 복잡도를 제한하고 과적합을 방지하기 위해 복잡도가 유한한 스무스하고 매개변수화된 활성화 함수를 도입함으로써 기존 AAFs에서 흔한 과적합 문제를 해결하기.
  • 매개변수 정규화 하에 SAAFs가 리프시츠 연속 모델을 제공함을 증명함으로써 회귀 과제에서 일반화 성능을 확보하기.
  • 다양한 회귀 데이터셋에서 고정형 및 비적응형 활성화 함수와 비교하여 SAAFs의 우수성을 실증적으로 검증하기.

제안 방법

  • 임의의 연속 함수를 임의의 정밀도로 근사할 수 있는 조각다항식 형태의 스무스 적응형 활성화 함수(SAAF)를 제안한다.
  • SAAFs를 기저 함수의 선형 조합으로 정의하며, 이 때 두 번째 도함수의 크기는 학습 가능한 가중치로 제어되어 형태 적응성이 가능하다.
  • 매개변수의 크기가 유한할 경우 SAAF 기반의 네트워크가 리프시츠 연속임을 증명함으로써 모델 복잡도가 유한해지도록 보장한다.
  • 지배적 복잡도의 상한을 지배하는 지방화 차원(fat-shattering dimension)을 사용하여 모델 복잡도의 상한을 유도하며, 이는 SAAF 매개변수의 L2 정규화를 통해 최소화된다.
  • SAAFs를 피드포워드 네트워크의 최종 은닉 레이어에 적용함으로써, 작업에 맞는 활성화 형태를 학습할 수 있도록 하여 회귀 성능 향상에 기여한다.
  • SAAF 매개변수에 L2 정규화를 적용하여 스무스함을 제어하고 과적합을 방지하며, 일반화를 위해 리프시츠 성질을 활용한다.

실험 결과

연구 질문

  • RQ1회귀 레이어에 적용된 적응형 활성화 함수는 고정형 활성화 함수에 비해 모델 편향을 크게 줄일 수 있는가?
  • RQ2조각다항식 구조를 가진 스무스하고 적응형 활성화 함수는 복잡한 회귀 함수에 대해 높은 근사 정확도를 달성할 수 있는가?
  • RQ3SAAFs의 매개변수 정규화가 회귀 과제에서 모델 복잡도를 효과적으로 제어하고 과적합을 방지하는 데 기여하는가?
  • RQ4SAAFs는 다양한 회귀 데이터셋에서 기존 AAFs와 비적응형 활성화 함수보다 더 잘 일반화되는가?

주요 결과

  • LSP 인간 자세 추정 데이터셋에서 SAAFc2 버전은 RMSE 3.801과 상관계수 0.745를 기록하여 모든 기준 방법보다 뛰어난 성능을 보였다.
  • 얼굴 매력도 예측 데이터셋에서 SAAFc2는 RMSE 3.801과 상관계수 0.745를 기록하여 관찰자 간 일치 수준에 근접했다.
  • 병리 영상에서 핵 원형도 추정 과제에서 R-SAAFc1은 RMSE 0.483과 상관계수 0.649를 기록하여 직접 세그멘테이션 기반 계산 방식(비교 RMSE 0.609)보다 뚜렷이 승리했다.
  • 이론적 분석을 통해 SAAFs는 매개변수 노름이 유한할 경우 리프시츠 연속 모델을 생성하며, 이는 유한한 지방화 차원과 과적합 위험 감소를 이끌어냈다.
  • 실증 결과에 따르면, 두 번째 도함수의 정규화가 효과적으로 이루어져 5000개의 다항식 세그먼트와 오직 21개의 학습 샘플만으로도 SAAFs가 잘 일반화됨을 확인했다.
  • SAAF 프레임워크는 자세 추정, 얼굴 매력도, 핵 형태학 예측을 포함한 모든 테스트된 회귀 데이터셋에서 일관되게 최고 성능을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.