[논문 리뷰] Towards Improving the Consistency, Efficiency, and Flexibility of Differentiable Neural Architecture Search
이 논문은 엔진 셀과 트랜지트 셀을 통해 검색과 평가를 분리함으로써 일致성, 효율성, 유연성을 향상시키는 미분 가능 신경망 아키텍처 탐색 프레임워크인 EnTranNAS를 제안한다. 이는 미분 가능 흐린화와 아키텍처 구조 학습을 가능하게 하여 CIFAR-10에서 0.06 GPU일, ImageNet에서 2.1 GPU일의 낮은 자원 소비로 최신 기준 성능을 달성하며, 자유롭고 제약 없는 아키텍처 구조를 지원한다.
Most differentiable neural architecture search methods construct a super-net for search and derive a target-net as its sub-graph for evaluation. There exists a significant gap between the architectures in search and evaluation. As a result, current methods suffer from an inconsistent, inefficient, and inflexible search process. In this paper, we introduce EnTranNAS that is composed of Engine-cells and Transit-cells. The Engine-cell is differentiable for architecture search, while the Transit-cell only transits a sub-graph by architecture derivation. Consequently, the gap between the architectures in search and evaluation is significantly reduced. Our method also spares much memory and computation cost, which speeds up the search process. A feature sharing strategy is introduced for more balanced optimization and more efficient search. Furthermore, we develop an architecture derivation method to replace the traditional one that is based on a hand-crafted rule. Our method enables differentiable sparsification, and keeps the derived architecture equivalent to that of Engine-cell, which further improves the consistency between search and evaluation. Besides, it supports the search for topology where a node can be connected to prior nodes with any number of connections, so that the searched architectures could be more flexible. For experiments on CIFAR-10, our search on the standard space requires only 0.06 GPU-day. We further have an error rate of 2.22% with 0.07 GPU-day for the search on an extended space. We can also directly perform the search on ImageNet with topology learnable and achieve a top-1 error rate of 23.8% in 2.1 GPU-day.
연구 동기 및 목표
- 아키텍처 갭으로 인해 미분 가능 NAS에서 검색과 평가 간의 일致성 문제를 해결하기 위해.
- 초넷 학습 시 메모리 및 계산 비용을 줄이기 위해 검색과 유도 과정을 분리하기 위해.
- 수동으로 설계된 구조 규칙 없이도 유연하고 자유로운 아키텍처 탐색을 가능하게 하기 위해.
- 트랜지트 셀 간의 특징 공유 전략을 통해 최적화 균형을 향상시키기 위해.
- 각 노드의 연결성을 임의로 설정할 수 있는 미분 가능 흐린화를 통해 아키텍처 구조 학습을 지원하기 위해.
제안 방법
- 미분 가능 아키텍처 탐색을 위한 엔진 셀과 경량이며 파rameter가 없는 아키텍처 유도를 위한 트랜지트 셀을 도입한다.
- 검색 중 파라미터 업데이트 균형을 맞추고 메모리 사용량을 줄이기 위해 특징 공유 전략을 적용한다.
- 유도된 아키텍처와 검색 시 아키텍처 간 등가성을 유지하는 미분 가능 흐린화 방법을 제안한다.
- 고정된 규칙(예: top-k 선택) 대신, 엔드 투 엔드 학습이 가능한 학습 가능한 아키텍처 파arameter화를 사용한다.
- 온도 감소를 적용한 군바르-소프트맥스와 흐린도 정규화 손실을 결합한 EnTranNAS-DST를 도입하여 자유로운 아키텍처 구조 학습을 가능하게 한다.
- 검색 과정에서 연결이 적응적으로 제거되는 점진적 흐린화 전략을 적용하여 성능를 유지하면서도 계산량을 줄인다.
실험 결과
연구 질문
- RQ1검색 시기와 평가 시기의 아키텍처 간 격차를 줄여 미분 가능 NAS에서의 일치성을 향상시킬 수 있는가?
- RQ2초넷 학습의 계산 및 메모리 오버헤드를 검색 품질을 희생시키지 않고 크게 줄일 수 있는가?
- RQ3노드가 이전 노드 중 어떤 수의 노드와나 연결될 수 있는 자유로운 아키텍처 구조를 미분 가능 아키텍처 탐색이 지원할 수 있는가?
- RQ4수동으로 설계된 제거 규칙(예: top-k 선택)보다 미분 가능 흐린화가 더 나은 일반화 성능을 보일 수 있는가?
- RQ5엔드 투 엔드 미분 가능 아키텍처 구조 학습이 기존 방법보다 검색 효율성과 정확도 면에서 뛰어나게 성능을 낼 수 있는가?
주요 결과
- EnTranNAS는 확장된 검색 공간에서 검색할 경우 CIFAR-10에서 2.22%의 top-1 오차율을 기록하며, 이는 단지 0.07 GPU일의 자원 소비로 달성된다.
- CIFAR-10에서 EnTranNAS는 표준 공간 검색에 0.06 GPU일만 소요되며, 이는 이전 방법 대비 검색 비용을 크게 줄인 것이다.
- EnTranNAS는 ImageNet에서 직접 검색을 수행하여 2.1 GPU일 내에 top-1 오차율 24.3%를 달성하며, 더 높은 검색 비용을 가진 기존 방법들을 능가한다.
- EnTranNAS-DST는 2.1 GPU일 내에 ImageNet에서 top-1 오차율 23.8%를 기록하며, EnTranNAS와 PC-DARTS를 초월하는 정확도를 확보하면서도 제약 없는 아키텍처 구조 학습을 지원한다.
- 절단 실험을 통해 하이퍼파rameter λ를 제어함으로써 다양한 용량과 아키텍처를 가진 네트워크의 검색이 가능하다는 것이 확인되었다.
- 이 방법은 효율성과 일치성 면에서 뛰어나며, 미분 가능 흐린화 덕분에 유도된 아키텍처가 검색 시 아키텍처와 동일하게 유지된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.