Skip to main content
QUICK REVIEW

[논문 리뷰] Automatic Configuration of Deep Neural Networks with EGO

Bas van Stein, Hao Wang|arXiv (Cornell University)|2018. 10. 10.
Advanced Neural Network Applications참고 문헌 23인용 수 8
한 줄 요약

이 논문은 완전히 구성 가능한 전결합형 신경망(All-CNN) 설계를 사용하여 복소 신경망(CNN) 아키텍처를 자동으로 설정하기 위해 병렬 효율적 글로벌 최적화(EGO) 프레임워크를 제안한다. 다수의 아키텍처를 병렬 평가하고 하이퍼파rameter와 레이어 구성에만 최적화함으로써, 데이터 증강 없이도 단지 10~50개의 학습 에포크와 200회의 평가로 MNIST 및 CIFAR-10에서 최신 기술 수준의 정확도를 달성하며 수작업으로 설계된 모델을 능가한다.

ABSTRACT

Designing the architecture for an artificial neural network is a cumbersome task because of the numerous parameters to configure, including activation functions, layer types, and hyper-parameters. With the large number of parameters for most networks nowadays, it is intractable to find a good configuration for a given task by hand. In this paper an Efficient Global Optimization (EGO) algorithm is adapted to automatically optimize and configure convolutional neural network architectures. A configurable neural network architecture based solely on convolutional layers is proposed for the optimization. Without using any knowledge on the target problem and not using any data augmentation techniques, it is shown that on several image classification tasks this approach is able to find competitive network architectures in terms of prediction accuracy, compared to the best hand-crafted ones in literature. In addition, a very small training budget (200 evaluations and 10 epochs in training) is spent on each optimized architectures in contrast to the usual long training time of hand-crafted networks. Moreover, instead of the standard sequential evaluation in EGO, several candidate architectures are proposed and evaluated in parallel, which saves the execution overheads significantly and leads to an efficient automation for deep neural network design.

연구 동기 및 목표

  • 깊은 신경망 아키텍처를 수작업으로 설계하는 데 드는 시간과 비효율성 문제를 해결하기 위해, 고차원적이고 이질적인 검색 공간으로 인해 어려움을 겪는 문제를 해결하기 위해.
  • 제한된 평가 예산을 가진 베이지안 최적화 방법을 사용하여, 하이퍼파ram터 및 아키텍처 탐색 중 깊은 네트워크 학습에 따른 계산 부담을 줄이기 위해.
  • 각 EGO 반복 단계에서 다수의 후보 아키텍처를 병렬 평가함으로써 신경망 아키텍처 탐색의 효율성을 향상시키고 실행 오버헤드를 감소시키기 위해.
  • 수작업으로 설계된 모델과 경쟁 가능한 성능을 달성할 수 있음을 보여주기 위해, 데이터 증강이나 작업에 대한 사전 지식 없이도.

제안 방법

  • 깊이, 너비, 커널 크기, 활성화 함수 등을 유연하게 설정할 수 있도록 오직 합성곱 레이어로 구성된 구성 가능한 All-CNN 아키텍처를 설계하였다.
  • 기존에 순차적으로 후보 아키텍처를 생성하는 것과는 달리, 각 반복에서 병렬적으로 다수의 후보 아키텍처를 생성하도록 EGO 알고리즘을 변형하였다.
  • 이전 평가 기반으로 검증 정확도를 예측하기 위해 가우시안 프로세스 서rogate 모델을 사용하였다.
  • 최적화 과정은 제한된 학습 예산(이상형 데이터셋은 10 에포크, CIFAR-10은 50 에포크)을 사용하며, 데이터 증강을 적용하지 않았다.
  • 아키텍처에 대한 인도크티브 바이어스 없이, 레이어 수, 필터 크기, 활성화 함수 등의 하이퍼파rameter를 기반으로 검색 공간을 정의하였다.
  • 이 방법은 벤치마크 이미지 분류 작업과 타타스틸의 실생활 강판 표면 결함 탐지 문제에 모두 적용되었다.

실험 결과

연구 질문

  • RQ1병렬 EGO 기반 접근법이 최소한의 인간 간섭과 학습 예산으로 고성능 CNN 아키텍처를 자동으로 발견할 수 있는가?
  • RQ2표준 이미지 분류 벤치마크에서 자동으로 설정된 All-CNN의 성능은 수작업으로 설계된 최신 기술 수준의 모델과 비교해 어떻게 되는가?
  • RQ3이러한 방법이 작업 전용 데이터 증강 없이도 실생활 산업 응용 분야, 예를 들어 강판 표면 결함 탐지에 얼마나 잘 일반화되는가?
  • RQ4병렬 EGO 전략은 순차적 EGO에 비해 신경망 아키텍처 탐색의 총 실행 시간을 얼마나 효과적으로 줄이는가?
  • RQ5후보 네트워크당 단지 10~50개의 학습 에포크로도 높은 정확도를 달성할 수 있는가?

주요 결과

  • 실생활 강판 표면 결함 탐지 작업에서 제안된 방법은 단지 0.5%의 거짓 경고율로 거의 90%의 진짜 양성률을 달성하여 수작업으로 설계된 기준 모델을 크게 능가하였다.
  • MNIST 데이터셋에서 최적화된 All-CNN는 데이터 증강 없이도 단지 10개의 학습 에포크와 200회의 평가로 경쟁 가능한 정확도를 달성하였다.
  • CIFAR-10에서 최적화된 아키텍처는 단지 50개의 학습 에포크와 200회의 평가로도 높은 정확도를 달성하여 최소한의 학습 예산 하에서도 강력한 일반화 성능을 보였다.
  • 병렬 EGO 전략은 순차적 EGO에 비해 실행 오버헤드를 크게 감소시켜 고성능 아키텍처에 더 빠르게 수렴하는 데 기여하였다.
  • 강판 결함 탐지 작업을 위한 최적화된 네트워크는 일반화 성능이 향상되었으며, 재학습 및 검증에 대해 최소한의 도메인 전문 지식이 필요로 하였다.
  • 이 방법은 데이터셋에 대한 사전 지식이나 데이터 증강 기법에 의존하지 않고도 효과적인 아키텍처를 성공적으로 발견하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.