Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Networks Designing Neural Networks: Multi-Objective Hyper-Parameter Optimization

Sean C. Smithson, Guang Yang|arXiv (Cornell University)|2016. 11. 07.
Neural Networks and Applications참고 문헌 20인용 수 18
한 줄 요약

이 논문은 반응 표면 모델링과 메타학습된 신경망을 사용하여 성능과 계산 비용을 예측하는 다목적 신경망 아키텍처 탐색 방법을 제안한다. 이는 광범위한 초매개변수 공간을 효율적으로 탐색할 수 있게 하며, MNIST 및 CIFAR-10 데이터셋에서 수동 설계 대비 설계 시간과 구현 비용을 최대 3배까지 감소시킨다. 이 방법은 단지 100회 반복만으로도 거의 파레토 최적해에 도달한다.

ABSTRACT

Artificial neural networks have gone through a recent rise in popularity, achieving state-of-the-art results in various fields, including image classification, speech recognition, and automated control. Both the performance and computational complexity of such models are heavily dependant on the design of characteristic hyper-parameters (e.g., number of hidden layers, nodes per layer, or choice of activation functions), which have traditionally been optimized manually. With machine learning penetrating low-power mobile and embedded areas, the need to optimize not only for performance (accuracy), but also for implementation complexity, becomes paramount. In this work, we present a multi-objective design space exploration method that reduces the number of solution networks trained and evaluated through response surface modelling. Given spaces which can easily exceed 1020 solutions, manually designing a near-optimal architecture is unlikely as opportunities to reduce network complexity, while maintaining performance, may be overlooked. This problem is exacerbated by the fact that hyper-parameters which perform well on specific datasets may yield sub-par results on others, and must therefore be designed on a per-application basis. In our work, machine learning is leveraged by training an artificial neural network to predict the performance of future candidate networks. The method is evaluated on the MNIST and CIFAR-10 image datasets, optimizing for both recognition accuracy and computational complexity. Experimental results demonstrate that the proposed method can closely approximate the Pareto-optimal front, while only exploring a small fraction of the design space.

연구 동기 및 목표

  • 저전력 모바일 및 임베디드 시스템에서 정확도와 계산 복잡도가 모두 중요한 만큼, 수동으로 신경망을 설계하는 데 도전하는 것.
  • 광범위하고 해석이 불가능한 설계 공간에서 초매개변수 탐색을 자동화하여 신경망 설계의 시간과 비용을 줄이는 것.
  • 완전한 평가 없이도 파레토 최적 해의 곡면을 근사화할 수 있는 확장성 있고 데이터 효율적인 방법을 개발하는 것.
  • 자동 설계가 수동으로 설계된 네트워크의 성능를 뛰어나거나 동일하게 유지하면서도 구현 비용을 크게 줄일 수 있음을 보여주는 것.

제안 방법

  • 응답 표면 모델(RSM)은 후보 신경망 아키텍처의 정확도와 계산 비용을 예측하기 위해 신경망을 사용하여 훈련된다.
  • RSM은 설계 공간 탐색(DSE) 알고리즘으로부터 새로운 평가를 반복적으로 업데이트하며, 불필요한 훈련을 줄이기 위해 유망한 영역에 집중한다.
  • DSE 알고리즘은 RSM을 활용하여 탐색을 이끌며, 높은 성능과 낮은 복잡도를 보일 것으로 예측되는 아키텍처를 우선순위로 한다.
  • 비용은 다중곱합 연산 수로 모델링되었으며, MLP 및 CNN 아키텍처를 사용해 MNIST 및 CIFAR-10에서 평가되었다.
  • RSM의 예측 오차는 모니터링되며, 이는 모델을 적응적으로 개선하는 데 사용되며, 마지막 95회 반복 동안 평균 오차가 0.35%로 감소하였다.
  • 설계 공간이 10^10개 이상의 해를 포함하더라도, 최소한의 훈련 평가로 다양하고 근사적인 파레토 최적 해의 곡면에 수렴하였다.

실험 결과

연구 질문

  • RQ1완전한 훈련 없이도 기계학습 모델이 신경망 아키텍처의 성능과 복잡도를 효과적으로 예측할 수 있는가?
  • RQ2다목적 설계 공간 탐색 방법은 고차원 초매개변수 공간에서 얼마나 효율적으로 근사적인 파레토 최적 해의 곡면에 수렴하는가?
  • RQ3자동 초매개변수 탐색이 정확도와 구현 비용 측면에서 수동 설계를 얼마나 뛰어나게 할 수 있는가?
  • RQ4반복적인 탐색 과정에서 응답 표면 모델의 정확도는 어떻게 변화하며, 수렴에 어떤 영향을 미치는가?

주요 결과

  • MNIST MLP 설계 공간에서 제안된 방법은 단지 100회 반복 후 진짜 파레토 최적 해에서 평균 5%의 편차(ADRS)를 기록하였다.
  • CIFAR-10 CNN 설계 공간에서, 이 방법은 문헌에 기록된 수동 설계 네트워크보다 25% 낮은 구현 비용을 기록하면서도 동일한 정확도를 유지하였다.
  • RSM의 예측 오차는 마지막 95회 반복 기간 동안 평균 0.35%로 감소하여 성능 예측의 높은 신뢰성을 보였다.
  • DSE 알고리즘이 MNIST CNN 설계를 18시간 내에 완료하였으며, 총 500번의 네트워크 평가만으로 제한된 서브셋에서의 완전한 탐색과 유사한 결과를 달성하였다.
  • 이 방법은 대규모 설계 공간에서도 확장성이 있었으며, 10^10개 이상의 구성이 가능한 CIFAR-10 CNN에서도 효율적인 수렴을 달성하였다.
  • 복잡하고 다목적 설계 공간의 고정밀도 탐색을 자동화함으로써 비재현 공정 비용(NRE)과 시장 진입 시간을 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.