Skip to main content
QUICK REVIEW

[논문 리뷰] Autonomously and Simultaneously Refining Deep Neural Network Parameters by a Bi-Generative Adversarial Network Aided Genetic Algorithm

Yantao Lu, Burak Kakillioglu|arXiv (Cornell University)|2018. 09. 24.
Advanced Neural Network Applications참고 문헌 14인용 수 4
한 줄 요약

이 논문은 이중 생성적 적대적 네트워크(Bi-GAN)를 활용한 유전 알고리즘(GA)인 Bi-GAN-GA를 제안하며, 이는 이산적인 후보 집합에 의존하지 않고도 다수의 딥 네트워크 하이퍼파라미터—예를 들어 필터 수, 뉴런 수, 커널 크기, 활성화 함수, 정규화 기법 등—을 자동으로 동시에 최적화한다. 이 방법은 GAN 프레임워크 내에서 두 개의 경쟁적 생성기들을 통해 연속적이고 적응적인 탐색을 가능하게 하여, 더 얕은 아키텍처임에도 불구하고 3D Shapenets(84.17%)와 GA 전용 기반 모델보다 높은 정확도(85.2%)를 달성한다.

ABSTRACT

The choice of parameters, and the design of the network architecture are important factors affecting the performance of deep neural networks. Genetic Algorithms (GA) have been used before to determine parameters of a network. Yet, GAs perform a finite search over a discrete set of pre-defined candidates, and cannot, in general, generate unseen configurations. In this paper, to move from exploration to exploitation, we propose a novel and systematic method that autonomously and simultaneously optimizes multiple parameters of any deep neural network by using a GA aided by a bi-generative adversarial network (Bi-GAN). The proposed Bi-GAN allows the autonomous exploitation and choice of the number of neurons, for fully-connected layers, and number of filters, for convolutional layers, from a large range of values. Our proposed Bi-GAN involves two generators, and two different models compete and improve each other progressively with a GAN-based strategy to optimize the networks during GA evolution. Our proposed approach can be used to autonomously refine the number of convolutional layers and dense layers, number and size of kernels, and the number of neurons for the dense layers; choose the type of the activation function; and decide whether to use dropout and batch normalization or not, to improve the accuracy of different deep neural network architectures. Without loss of generality, the proposed method has been tested with the ModelNet database, and compared with the 3D Shapenets and two GA-only methods. The results show that the presented approach can simultaneously and successfully optimize multiple neural network parameters, and achieve higher accuracy even with shallower networks.

연구 동기 및 목표

  • 딥 네트워크 아키텍처와 하이퍼파라미터를 최적화하기 위한 체계적이고 자동화된 방법의 부족을 해결하기 위해.
  • 기존의 이산적이고 사전 정의된 후보 집합에 의존하는 전통적 유전 알고리즘(GA)의 한계를 극복하기 위해.
  • 필터 수, 뉴런 수, 커널 크기, 활성화 함수, 정규화 선택(예: 드롭아웃, 배치 정규화)과 같은 핵심 네트워크 파라미터의 자동 연속적 개선을 가능하게 하기 위해.
  • 지능적이고 적응적인 하이퍼파라미터 탐색을 통해 정확도를 향상시키면서도 네트워크 깊이를 줄이기 위해.
  • 아키텍처 재설계 없이 다양한 딥 러닝 아키텍처에 적용 가능한 통합 프레임워크를 개발하기 위해.

제안 방법

  • 이 방법은 유전 알고리즘(GA)과 새로운 이중 생성적 적대적 네트워크(Bi-GAN)를 통합하며, 하이퍼파라미터 공간에서 연속적이고 적응적인 탐색을 가능하게 하기 위해 두 개의 생성기와 두 개의 구분기로 구성된다.
  • Bi-GAN 내의 두 생성기는 후보 네트워크 구성(예: 필터 수, 뉴런 수)을 생성하며, 상호 적대적으로 훈련되어 생성된 아키텍처의 품질과 다양성을 향상시킨다.
  • GA는 네트워크 구성의 집단을 진화시키며, 적합도는 검증 정확도에 기반한다. Bi-GAN은 이산적인 집합을 초월한 새로운 고성능 구성의 생성을 통해 탐색을 강화한다.
  • 이 프레임워크는 아키텍처 선택을 자동으로 결정한다: 합성곱/밀집 층 수, 커널 크기, 필터 수, 뉴런 수, 활성화 함수, 배치 정규화 또는 드롭아웃 사용 여부.
  • 생성기와 구분기 간의 적대적 훈련을 통해, 시스템은 유망한 구성들을 활용하고 GA 진화 과정에서 반복적으로 개선할 수 있다.
  • 이 접근법은 3D 모양 분류 벤치마크를 사용하여 ModelNet 데이터셋에서 평가되었으며, 3D Shapenets와 두 개의 GA 전용 기반 모델과의 비교를 포함한다.

실험 결과

연구 질문

  • RQ1Bi-GAN를 보조로 사용한 GA 프레임워크는 필터 수, 뉴런 수, 커널 크기, 정규화 선택과 같은 다수의 딥 네트워크 하이퍼파라미터를 자동으로 동시에 최적화할 수 있는가?
  • RQ2이러한 제안된 방법은 이산적이고 사전 정의된 하이퍼파라미터 집합에 의존하는 기존의 GA 전용 접근법보다 정확도와 수렴 속도 측면에서 뛰어나게 성능을 발휘하는가?
  • RQ3Bi-GAN 프레임워크는 사전 정의된 후보 값에 제약을 받지 않는 새로운 고성능 네트워크 아키텍처를 생성할 수 있는가?
  • RQ4수정된 수의 층을 사용함에도 불구하고, 수작업으로 설계된 모델인 3D Shapenets보다 더 높은 정확도를 달성할 수 있는가?
  • RQ5GA 구성 요소의 다양한 개체 수에 따라 제안된 방법의 성능는 어떻게 변화하는가?

주요 결과

  • 제안된 Bi-GAN-GA 방법은 ModelNet 데이터셋에서 테스트 정확도 85.2%를 달성하였으며, 3D Shapenets 모델(84.17%)과 모든 GA 전용 기반 모델을 초월하였다.
  • 모든 테스트 구성에서 소규모 후보 집합을 사용한 GA(82.94%)와 대규모 후보 집합을 사용한 GA(36.41%)보다 높은 정확도를 기록하여 뛰어난 최적화 능력을 입증하였다.
  • 이 방법은 각각 80, 105, 202개의 필터를 가진 3개의 합성곱 층 아키텍처를 발견하였으며, 이는 4개의 합성곱 층을 가진 Shapenets 모델보다 더 높은 정확도를 달성하였다.
  • 최대 5개의 합성곱 층을 허용할 경우, 방법은 86.62%의 정확도에 도달하였으며, 이는 깊이 있는 아키텍처로의 확장성과 잠재적 가능성을 시사한다.
  • 모든 테스트된 개체 수(5, 10, 20)에서 소규모 후보 집합 GA보다 일관되게 높은 정확도와 더 빠른 수렴 속도를 보였으며, 그림 8과 9에서 이를 확인할 수 있었다.
  • 최종적으로 선택된 아키텍처는 첫 번째 밀집 층에 601개의 뉴런과 두 번째 밀집 층에 240개의 뉴런을 포함하였으며, 활성화 함수로 Leaky ReLU와 ReLU를 사용했고, 마지막 밀집 층에 드롭아웃을 적용하여 효과적인 자동 아키텍처 탐색을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.