[논문 리뷰] Cyclic Differentiable Architecture Search
이 논문은 순환 가능한 미분 가능 아키텍처 탐색 프레임워크인 CDARTS를 제안한다. 이는 내성적 드롭아웃 정규화를 통해 탐색 네트워크와 평가 네트워크를 통합함으로써 교차 훈련을 통한 동시 최적화를 가능하게 한다. 깊이 있는 평가 네트워크로부터의 피드백을 반복적으로 활용하여 아키텍처 가중치를 정교화함으로써, CDARTS는 상태의 기준을 초월하는 성능을 달성한다—CIFAR-10에서 97.52%의 top-1 정확도와 ImageNet에서 76.3%를 기록하며, DARTS와 유사한 낮은 탐색 비용을 유지한다.
Differentiable ARchiTecture Search, i.e., DARTS, has drawn great attention in neural architecture search. It tries to find the optimal architecture in a shallow search network and then measures its performance in a deep evaluation network. The independent optimization of the search and evaluation networks, however, leaves room for potential improvement by allowing interaction between the two networks. To address the problematic optimization issue, we propose new joint optimization objectives and a novel Cyclic Differentiable ARchiTecture Search framework, dubbed CDARTS. Considering the structure difference, CDARTS builds a cyclic feedback mechanism between the search and evaluation networks with introspective distillation. First, the search network generates an initial architecture for evaluation, and the weights of the evaluation network are optimized. Second, the architecture weights in the search network are further optimized by the label supervision in classification, as well as the regularization from the evaluation network through feature distillation. Repeating the above cycle results in joint optimization of the search and evaluation networks and thus enables the evolution of the architecture to fit the final evaluation network. The experiments and analysis on CIFAR, ImageNet and NAS-Bench-201 demonstrate the effectiveness of the proposed approach over the state-of-the-art ones. Specifically, in the DARTS search space, we achieve 97.52% top-1 accuracy on CIFAR10 and 76.3% top-1 accuracy on ImageNet. In the chain-structured search space, we achieve 78.2% top-1 accuracy on ImageNet, which is 1.1% higher than EfficientNet-B0. Our code and models are publicly available at https://github.com/microsoft/Cream.
연구 동기 및 목표
- DARTS에서 탐색 네트워크와 평가 네트워크 간의 성능 격차를 해결하여, 독립적인 최적화가 아키텍처의 일반화 능력을 제한하는 문제를 해결한다.
- DARTS가 최적화가 비효율적으로 이루어져 스위치 연결이 지배하는 아키텍처로 악화되는 문제를 해결한다.
- 탐색 네트워크와 평가 네트워크의 동시 최적화를 통해 최종 평가 모델로의 아키텍처 이식성 향상을 도모한다.
- 외부 교사 모델에 의존하지 않고 평가 네트워크 자체에서 내성적 드롭아웃 정규화를 통해 지식 전이를 실현하는 통합 프레임워크를 개발한다.
- 낮은 탐색 비용을 유지하면서도 얕은 탐색 네트워크와 깊은 평가 네트워크 간의 순환 피드백을 통해 성능을 향상시킨다.
제안 방법
- 탐색 네트워크가 평가를 위한 아키텍처를 생성하고, 평가 네트워크의 성능이 피드백으로 돌아오는 순환 훈련 루프를 도입한다.
- 외부 교사 모델 없이도 깊은 평가 네트워크에서 탐색 네트워크로 지식을 전이하기 위해 내성적 드롭아웃 정규화를 사용한다.
- 레이블 감독과 평가 네트워크의 특징 수준 정규화를 모두 활용하여 탐색 네트워크의 아키텍처 가중치를 최적화한다.
- DARTS와 유사하게 일阶 근사법을 적용하여 효율적인 아키텍처 탐색을 확보함으로써 낮은 계산 비용을 유지한다.
- 탐색 네트워크와 평가 네트워크를 번갈아가며 훈련시켜 아키텍처 탐색을 최종 평가 목표와 일치시키는 통합 프레임워크를 구축한다.
- 가중치 공유와 경량 평가 네트워크를 활용하여 순환 최적화 과정 중 훈련 오버헤드를 줄인다.
실험 결과
연구 질문
- RQ1탐색 네트워크와 평가 네트워크의 순환적 동시 최적화가 독립적인 탐색과 평가를 넘어서 아키텍처 일반화 능력을 향상시킬 수 있는가?
- RQ2외부 교사 모델 없이 평가 네트워크에서만 내성적 드롭아웃 정규화를 활용하면 아키텍처 탐색 성능이 향상되는가?
- RQ3CDARTS는 DARTS에서 스위치 연결이 지배하는 아키텍처로 악화되는 문제를 완화할 수 있는가?
- RQ4순환 피드백 메커니즘이 표준 벤치마크에서 검색된 아키텍처의 최종 정확도와 강건성에 어떤 영향을 미치는가?
- RQ5CDARTS의 계산 오버헤드는 표준 DARTS에 비해 얼마나 되며, 빠른 탐색 속도를 유지할 수 있는가?
주요 결과
- CDARTS는 CIFAR-10에서 97.52%의 top-1 정확도를 달성하여 DARTS 탐색 공간 내 이전 최고 성능 기록을 초월한다.
- ImageNet에서는 76.3%의 top-1 정확도를 기록하여 대규모 데이터셋에서 강력한 이식성과 성능을 입증한다.
- 체인 구조 탐색 공간에서 CDARTS는 ImageNet에서 78.2%의 top-1 정확도를 기록하며, EfficientNet-B0를 1.1%포인트 초월한다.
- Cityscapes에서는 추론 트릭 없이도 78.1%의 mIoU를 달성하여, FasterSeg보다 5.0%포인트, SegFormer보다 1.9%포인트 뛰어나며 FLOPs도 더 적게 소비한다.
- ADE20K에서는 단지 5.9G FLOPs로 40.4%의 mIoU를 기록하며, SegFormer을 3.0%포인트 초월했고, 크기가 훨씬 작다.
- CDARTS의 계산 비용은 DARTS의 약 1.3배이며, 평가 네트워크의 비용은 탐색 네트워크의 약 1/3에서 1/2 정도로 추가된다. 이로 인해 8개의 GPU로 ImageNet에서 약 5시간 내에 빠른 탐색이 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.