Skip to main content
QUICK REVIEW

[논문 리뷰] DHA: End-to-End Joint Optimization of Data Augmentation Policy, Hyper-parameter and Architecture

Kaichen Zhou, Lanqing Hong|arXiv (Cornell University)|2021. 09. 13.
Advanced Neural Network Applications참고 문헌 64인용 수 8
한 줄 요약

DHA는 재학습이 필요 없도록 데이터 증강(DA) 정책, 하이퍼파rameter 최적화(HPO), 신경망 아키텍처 탐색(NAS)을 종합적으로 최적화하는 엔드 투 엔드, 미분 가능한 프레임워크를 제안한다. DA와 HPO를 동적 스케줄러로 모델링하고 압축된 특징 공간을 최적화함으로써, ImageNet(77.4% Top-1) 및 여러 벤치마크에서 최신 기준(SOTA) 성능을 달성하면서도 낮은 계산 비용을 실현한다.

ABSTRACT

Automated machine learning (AutoML) usually involves several crucial components, such as Data Augmentation (DA) policy, Hyper-Parameter Optimization (HPO), and Neural Architecture Search (NAS). Although many strategies have been developed for automating these components in separation, joint optimization of these components remains challenging due to the largely increased search dimension and the variant input types of each component. In parallel to this, the common practice of searching for the optimal architecture first and then retraining it before deployment in NAS often suffers from low performance correlation between the searching and retraining stages. An end-to-end solution that integrates the AutoML components and returns a ready-to-use model at the end of the search is desirable. In view of these, we propose DHA, which achieves joint optimization of Data augmentation policy, Hyper-parameter and Architecture. Specifically, end-to-end NAS is achieved in a differentiable manner by optimizing a compressed lower-dimensional feature space, while DA policy and HPO are regarded as dynamic schedulers, which adapt themselves to the update of network parameters and network architecture at the same time. Experiments show that DHA achieves state-of-the-art (SOTA) results on various datasets and search spaces. To the best of our knowledge, we are the first to efficiently and jointly optimize DA policy, NAS, and HPO in an end-to-end manner without retraining.

연구 동기 및 목표

  • DA, HPO, NAS를 별도로 최적화하는 순차적 AutoML 파이프라인의 비효율성과 열등한 성능 문제를 해결한다.
  • 이중 단계 NAS 및 DA 방법에서 흔히 발생하는 탐색 단계와 재학습 단계 간의 성능 격차를 극복한다.
  • 모델 일반화 및 효율성을 향상시키기 위해 DA, HPO, NAS를 하나의 미분 가능한 엔드 투 엔드 학습 과정에서 동시에 최적화할 수 있도록 한다.
  • 고차원 아키텍처 공간 대신 압축된 저차원 특징 공간을 최적화하여 탐색 공간의 복잡성을 낮춘다.
  • 다양한 AutoML 구성요소를 종합적으로 최적화할 경우 순차적 또는 쌍별 최적화보다 뛰어난 성능 향상을 이끌 수 있음을 입증한다.

제안 방법

  • 네트워크 아키텍처와 파라미터의 변화에 실시간으로 적응하는 동적 스케줄러로 DA 및 HPO를 모델링한다.
  • 희소 코딩을 사용하여 압축된 저차원 특징 공간을 최적화하는 방식으로 엔드 투 엔드 NAS를 구현한다.
  • DA 정책, HPO, NAS를 하나의 미분 가능한 최적화 목표에 통합하여 종합적이고 동시에 업데이트할 수 있도록 한다.
  • 모든 구성요소를 엔드 투 엔드로 직접 최적화함으로써 재학습을 방지하는 통합 학습 과정을 구현하여 탐색 단계와 구현 단계 간 일관성을 유지한다.
  • 모든 AutoML 구성요소(아키텍처, 증강, 하이퍼파ram터 포함)에서 기울기 기반 최적화를 가능하게 하기 위해 미분 가능한 연산을 활용한다.
  • 손실 경관을 시각화하고 분석하기 위해 필터 정규화를 적용하여, DHA가 순차적 방법보다 더 평탄하고 매끄러운 국소 최소값을 가지는 것으로 확인한다.

실험 결과

연구 질문

  • RQ1재학습 없이도 데이터 증강, 하이퍼파ram터 튜닝, 신경망 아키텍처 탐색을 엔드 투 엔드로 종합 최적화할 수 있는가?
  • RQ2종합 최적화가 순차적 최적화에 비해 최종 모델 정확도와 학습 안정성 측면에서 어떻게 비교되는가?
  • RQ3종합 최적화가 손실 경관의 기하학적 특성, 특히 평탄성과 일반화 능력에 어떤 영향을 미치는가?
  • RQ4세 가지 AutoML 구성요소(DA, HPO, NAS)를 모두 통합 최적화할 경우, 두 개만 최적화하는 것보다 성능 향상이 더 큰가?
  • RQ5압축된 특징 공간 표현이 높은 정확도와 낮은 계산 비용을 유지하면서도 미분 가능한 NAS를 효과적으로 가능하게 하는가?

주요 결과

  • DHA는 셀 기반 탐색 공간을 사용하여 ImageNet에서 77.4%의 Top-1 정확도를 달성하며, 이는 이전 최신 기준(SOTA)보다 0.5% 높은 성능이다.
  • CIFAR10, CIFAR100, SPORT8, MIT67, FLOWERS102 및 ImageNet에서 DHA는 기존 방법보다 낮은 계산 비용으로 최신 기준 성능을 달성한다.
  • DHA의 손실 경관은 Sequential-DHA 및 One-Stage ISTA보다 더 평탄하고 매끄럽다. 이는 더 뛰어난 일반화 능력과 강건성을 의미한다.
  • 세 구성요소(DA, HPO, NAS)의 종합 최적화가 어떤 쌍별 또는 순차적 조합보다 더 높은 테스트 정확도를 제공하며, 특히 NAS에 DA를 추가할 경우 성능 향상이 가장 크다.
  • 엔드 투 엔드 학습 과정은 더 매끄러운 검증 정확도 곡선을 만들어내며, 재학습으로 인한 성능 저하가 발생하지 않는다는 점에서 순차적 방법과 대비된다.
  • 광범위한 추상화 연구(ablation studies)를 통해 DHA의 종합 최적화 전략이 모든 평가된 데이터셋에서 순차적 또는 쌍별 최적화를 크게 능가한다는 것이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.