Skip to main content
QUICK REVIEW

[논문 리뷰] DeepLABNet: End-to-end Learning of Deep Radial Basis Networks with Fully Learnable Basis Functions

Andrew Hryniowski, Alexander Wong|arXiv (Cornell University)|2019. 11. 20.
Neural Networks and Applications인용 수 7
한 줄 요약

DeepLABNet은 완전히 학습 가능한 기저 함수를 갖춘 엔드 투 엔드 학습이 가능한 깊이 있는 라디얼 기저 함수(RBF) 네트워크를 도입하여 계층적이고 적응적인 비선형 활성화를 가능하게 한다. 채널 간 종속성을 분리하고, 폴리하모닉 RBF를 사용하며, 전략적인 정규화를 적용함으로써, CIFAR-10과 CIFAR-100에서 최신 기준 성능을 달성하며, FLOPs와 파라미터 수가 유사한 ReLU 기반 ResNets보다 최대 5.7% 높은 정확도를 기록한다.

ABSTRACT

From fully connected neural networks to convolutional neural networks, the learned parameters within a neural network have been primarily relegated to the linear parameters (e.g., convolutional filters). The non-linear functions (e.g., activation functions) have largely remained, with few exceptions in recent years, parameter-less, static throughout training, and seen limited variation in design. Largely ignored by the deep learning community, radial basis function (RBF) networks provide an interesting mechanism for learning more complex non-linear activation functions in addition to the linear parameters in a network. However, the interest in RBF networks has waned over time due to the difficulty of integrating RBFs into more complex deep neural network architectures in a tractable and stable manner. In this work, we present a novel approach that enables end-to-end learning of deep RBF networks with fully learnable activation basis functions in an automatic and tractable manner. We demonstrate that our approach for enabling the use of learnable activation basis functions in deep neural networks, which we will refer to as DeepLABNet, is an effective tool for automated activation function learning within complex network architectures.

연구 동기 및 목표

  • 딥 네URAL 네트워크에서 정적이고 학습 불가능한 활성화 함수의 한계를 극복하기 위해, 라디얼 기저 함수(RBF) 활성화 함수의 엔드 투 엔드 학습을 가능하게 하는 것.
  • 기존 RBF 네트워크를 깊이 있는 아키텍처에 통합하는 데 있어 역사적으로 지속된 불안정성과 비가역성 문제를 해결하기 위해, 새로운 안정적인 훈련 프레임워크를 도입하는 것.
  • 딥 러닝에서 고정된 활성화 함수의 대체로 학습 가능한 RBF의 잠재력을 탐색하고, 특히 계층적 네트워크 설계에서의 적용 가능성을 탐구하는 것.
  • 다양한 모델 크기와 데이터셋에서 학습 가능한 RBF의 성능을 평가하고, 기존의 ReLU 기반 네트워크와 비교하는 것.
  • 학습 가능한 RBF가 표준 ReLU 네트워크와 단일층 RBF 네트워크보다 더 높은 정확도를 달성할 수 있음을 입증하며, 특히 작은 모델과 더 복잡한 데이터셋에서 두드러진 성능 향상을 보이는지 확인하는 것.

제안 방법

  • 서브-RBF 네트워크 내에서 채널 간 종속성을 분리함으로써 훈련 안정성과 확장성 향상을 도모한다.
  • 다양한 비선형 변환을 가능하게 하는 탄력적인 학습 가능한 비선형 변환 단위로 폴리하모닉 라디얼 기저 함수를 핵심 활성화 유닛으로 사용한다.
  • 훈련 불안정성과 국소 최적값의 위험을 줄이기 위해 전략적인 정규화 및 초기화 기법을 도입한다.
  • RBF 중심과 커널 계수를 포함한 전체 네트워크를 통해 엔드 투 엔드 백프로파게이션을 가능하게 하여 기저 함수의 완전한 파rameter화를 허용한다.
  • RBF 출력의 선형 조합(y = λh)을 사용해 최종 예측을 생성하며, λ와 RBF 중심(c_p)을 함께 훈련 중 최적화한다.
  • 과적합과 성능 변동성을 관리하기 위해 학습률 스케줄링과 조기 정지 기법을 적용한 수정된 훈련 루틴을 적용한다.

실험 결과

연구 질문

  • RQ1완전히 학습 가능한 라디얼 기저 함수가 엔드 투 엔드 훈련이 가능한 깊이 있는 신경망 아키텍처에 효과적으로 통합될 수 있는가?
  • RQ2CIFAR-10과 CIFAR-100에서 다양한 모델 크기에서 DeepLABNet의 성능가 표준 ReLU 기반 ResNets와 비교해 볼 때 어떻게 되는가?
  • RQ3고정된 활성화 함수 대비 학습 가능한 RBF를 사용할 경우, 훈련 시간, 과적합, 성능 변동성의 상충 관계는 어떠한가?
  • RQ4복잡하고 계층적인 작업에서 DeepLABNet은 단일층 RBF 네트워크나 표준 ReLU 네트워크보다 더 나은 표현 학습 성능을 달성하는가?
  • RQ5DeepLABNet은 모델 크기를 줄이며 높은 정확도를 유지할 수 있는가? 이는 엣지 배포에 적합한가?

주요 결과

  • DeepLABNet은 CIFAR-100에서 ReLU 기반 ResNet-8보다 5.7% 높은 정확도를 기록하여, 작은 모델과 복잡한 데이터셋에서의 뚜렷한 성능 향상을 입증한다.
  • CIFAR-10에서 DeepLABNet은 ResNet-50를 사용해 91.9%의 정확도를 달성하며, ReLU 기반 기준선보다 0.3% 높은 성능을 보이며, 단지 23100만 FLOPs만을 소비한다.
  • ResNet-32 기반으로는 CIFAR-10에서 91.6%의 정확도, CIFAR-100에서는 67.8%의 정확도를 기록하여, 더 큰 ReLU 기반 ResNet-50 모델의 성능을 충족하거나 초월한다.
  • Nvidia GTX 1080 Ti에서 ResNet-8의 훈련 시간은 50% 증가하고, ResNet-50의 경우 150% 증가하여 훈련 효율성의 상충 관계가 드러난다.
  • 더 큰 모델에서 훈련 시간이 길어질수록 과적합과 성능 변동성이 증가하는 경향을 보이며, 특히 동일한 학습률로 장기간 훈련할 경우 두드러진다.
  • 높은 변동성에도 불구하고, 모든 모델 크기와 데이터셋에서 ReLU 기준선보다 일관되게 높은 평균 성능를 기록함으로써, 자동화된 활성화 함수 학습의 효과성을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.