[논문 리뷰] EDAS: Efficient and Differentiable Architecture Search
EDAS는 이론적 탐색을 위한 단일 에지 샘플링을 통해 이론화를 최소화하면서도 이산 아키텍처 행동을 유지하고, 프루닝 이후 성능 저하를 제거하는 차별화된 미분 가능 아키텍처 탐색 방법을 제안한다. 깊이 있는 네트워크를 허용하면서도 이론화를 최소화함으로써, EDAS는 단지 0.125 GPU 일의 계산 비용으로 CIFAR-10, CIFAR-100, ImageNet에서 최신 기준 성능을 달성하며, DARTS와 P-DARTS를 뛰어넘는다.
Transferrable neural architecture search can be viewed as a binary optimization problem where a single optimal path should be selected among candidate paths in each edge within the repeated cell block of the directed a cyclic graph form. Recently, the field of differentiable architecture search attempts to relax the search problem continuously using a one-shot network that combines all the candidate paths in search space. However, when the one-shot network is pruned to the model in the discrete architecture space by the derivation algorithm, performance is significantly degraded to an almost random estimator. To reduce the quantization error from the heavy use of relaxation, we only sample a single edge to relax the corresponding variable and clamp variables in the other edges to zero or one. By this method, there is no performance drop after pruning the one-shot network by derivation algorithm, due to the preservation of the discrete nature of optimization variables during the search. Furthermore, the minimization of relaxation degree allows searching in a deeper network to discover better performance with remarkable search cost reduction (0.125 GPU days) compared to previous methods. By adding several regularization methods that help explore within the search space, we could obtain the network with notable performances on CIFAR-10, CIFAR-100, and ImageNet.
연구 동기 및 목표
- 과도하게 파rameter화된 one-shot 네트워크와 프루닝 이후 발생하는 양자화 오차로 인한 성능 저하 문제를 해결하기 위해.
- 기존 one-shot 미분 가능 NAS 방법과 비교해 정확도를 유지하거나 향상시키면서도 탐색 비용을 감소시키기 위해.
- 학습 중 아키텍처 파라미터 순위를 동적으로 조정함으로써 탐색 공간 내 탐색을 향상시키기 위해.
- 메모리 및 최적화 과제를 완화함으로써 깊은 네트워크에서 효과적인 아키텍처 탐색을 가능하게 하기 위해.
제안 방법
- EDAS는 각 반복에서 단일 에지만 이론화하고, 나머지 모든 에지는 가장 높은 아키텍처 파라미터 기반으로 고정하여 단일 연산을 수행한다.
- 아키텍처 파라미터는 경사 하강법을 통해 업데이트되지만, 유일하게 선택된 에지만 이론화되어 나머지 네트워크의 이산적 행동이 유지된다.
- 초기 에포크에서 서명 반전 전략(EDAS-inv)을 적용하여 후보 연산 간 학습 경험을 공정하게 분배하고 탐색을 향상시킨다.
- 탐색 공간의 탐색을 향상시키고 조기 수렴을 방지하기 위해 정규화 기법을 적용한다.
- one-shot 네트워크는 종단 간 훈련되며, 최종 아키텍처는 각 에지에 대해 가장 높은 아키텍처 파라미터를 가진 연산을 선택함으로써 유도된다.
- 각 에지에 대한 계산을 제한함으로써 깊이 차이 문제를 피하고, 더 깊은 아키텍처로의 확장성을 확보한다.
실험 결과
연구 질문
- RQ1과도한 파rameter화와 프루닝 이후 발생하는 양자화 오차를 방지함으로써, 미분 가능 아키텍처 탐색 방법이 프루닝 이후에도 높은 성능을 유지할 수 있는가?
- RQ2DARTS의 전체 이론화와 비교해 각 반복에서 단일 에지만 이론화하는 방식이 탐색 효율성과 최종 아키텍처 품질에 어떤 영향을 미치는가?
- RQ3아키텍처 파라미터 순위를 동적으로 조정함으로써 탐색 공간의 탐색을 향상시킬 경우 성능 향상이 이루어질 수 있는가?
- RQ4이론화 정도를 감소시킴으로써 계산 비용을 최소화하면서도 깊은 네트워크 아키텍처에서 효과적인 탐색이 가능한가?
- RQ5제안된 방법이 여러 벤치마크(CIFAR-10, CIFAR-100, ImageNet)에서 0.125 GPU 일 이하의 탐색 비용으로 최신 기준 성능을 달성할 수 있는가?
주요 결과
- EDAS는 CIFAR-10에서 97.32%의 테스트 정확도를 달성하여, DARTS(97.12%)와 P-DARTS(97.25%)를 뛰어넘으며 현저히 낮은 탐색 비용을 기록한다.
- CIFAR-100에서는 90.68%의 상위-1 정확도를 기록하여, 이전 방법이 향상되지 않았던 더 복잡한 데이터셋에서도 효과를 입증한다.
- 탐색 비용은 0.125 GPU 일로 감소하여 DARTS의 약 1/12 수준이 되었으며, 이는 새로운 작업에 대한 빠른 아키텍처 탐색을 가능하게 한다.
- 초기 에포크에서 서명 반전 전략을 적용한 EDAS-inv는 표준 EDAS보다 더 나은 탐색과 높은 성능을 보이며, 향상된 탐색 역학을 확인한다.
- EDAS에서 파생된 아키텍처는 훈련 에포크가 진행되면서 일관되게 정확도 향상을 보이며, 알고리즘의 효과적인 탐색 능력을 확인한다.
- EDAS의 아키텍처 파라미터 순위는 훈련 중에 동적으로 변화하며, α-max와 달리 순위가 조기에 안정화되지 않음을 확인하여 열악한 탐색 능력을 가진다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.