[논문 리뷰] Optimal Transport Kernels for Sequential and Parallel Neural Architecture Search
이 논문은 신경망 아키텍처 탐색(NAS)를 위한 새로운 트리-워샤르스타인(TW) 거리 측도를 제안하며, 이는 가우시안 프로세스(GP) 모델과 k-결정행렬점프로세스(k-DPP)에 대해 양의 준정의 양식의 커널을 가능하게 하여 병렬 NAS를 실현한다. 아키텍처를 n-그램 및 진입/진출도 특징으로 인코딩함으로써 TW는 전반적이고 국소적인 구조를 포착하며, 순차적 및 병렬 NAS 환경 모두에서 기존 방법들을 능가하는 성능을 보이며, 더 빠르고 확장 가능한 계산을 제공한다.
Neural architecture search (NAS) automates the design of deep neural networks. One of the main challenges in searching complex and non-continuous architectures is to compare the similarity of networks that the conventional Euclidean metric may fail to capture. Optimal transport (OT) is resilient to such complex structure by considering the minimal cost for transporting a network into another. However, the OT is generally not negative definite which may limit its ability to build the positive-definite kernels required in many kernel-dependent frameworks. Building upon tree-Wasserstein (TW), which is a negative definite variant of OT, we develop a novel discrepancy for neural architectures, and demonstrate it within a Gaussian process surrogate model for the sequential NAS settings. Furthermore, we derive a novel parallel NAS, using quality k-determinantal point process on the GP posterior, to select diverse and high-performing architectures from a discrete set of candidates. Empirically, we demonstrate that our TW-based approaches outperform other baselines in both sequential and parallel NAS.
연구 동기 및 목표
- 복잡하고 비연속적인 신경망 아키텍처를 비교하기 위한 구조적 복잡성에 강건한 유사도 측도를 개발함으로써 도전 과제 해결.
- 기존 최적 운반(OT) 기반 방법의 한계를 극복하기 위해, 가우시안 프로세스에 대해 양의 준정의 커널을 보장하는 음의 정의형 변종인 트리-워샤르스타인을 개발함.
- 이산 후보들 중에서 다양하고 높은 성능을 보이는 아키텍처를 선택할 수 있도록, k-결정행렬점프로세스(k-DPP)를 설계하여 효과적인 병렬 NAS 실현.
- 제안된 TW 기반 프레임워크를 사용하여 순차적 및 병렬 NAS 환경 모두에서 성능 향상을 입증함.
- 기존의 계산 비용이 큰 OT와는 달리, 폐쇄형 TW 계산을 활용하여 대규모 아키텍처와의 호환성과 계산 확장성을 확보함.
제안 방법
- 신경망 아키텍처의 구조를 포착하기 위해 n-그램 및 진입/진출도 표현을 사용한 새로운 트리-워샤르스타인(TW) 거리 측도 설계. 이는 국소적 및 전반적 특징을 모두 반영함.
- 순차적 NAS에서 가우시안 프로세스(GP) 대체 모델에 사용 가능한 양의 준정의(p.s.d.) 커널을 TW로부터 구성함으로써 유효한 확률적 추론 보장.
- 병렬 NAS에서 다수의 다양하고 높은 성능을 보이는 아키텍처를 선택하기 위해 GP 사후분포를 활용한 k-결정행렬점프로세스(k-DPP) 설계. 이는 탐욕적 선택 방식을 피함.
- GP 예측 분산 기반의 k-DPP 품질 함수를 설정함으로써, 다수의 다양하고 높은 정확도를 가진 후보들을 동시에 확보 가능하게 함.
- TW 거리의 폐쇄형 계산을 구현함으로써, 트리의 간선 수에 대해 선형 시간 복잡도를 달성함. 이는 초입방정식 복잡도를 가지는 OT와는 대비됨.
- 순차적 NAS에서 표준 할당 함수(GP-UCB, EI 등)와 TW를 통합하고, NASBench101 및 NASBench201 벤치마크에서 성능 평가 수행.
실험 결과
연구 질문
- RQ1최적 운반(OT)의 음의 정의형 변종을 구성하여, 신경망 아키텍처 탐색에서 가우시안 프로세스 모델에 대해 유효한 양의 준정의 커널을 가능하게 할 수 있는가?
- RQ2기존 OT 및 기타 유사도 측도와 비교하여 제안된 트리-워샤르스타인(TW) 거리가 NAS에서 아키텍처 유사도를 얼마나 잘 포착하는가?
- RQ3GP 사후분산에 기반한 k-결정행렬점프로세스(k-DPP)가 병렬 NAS에서 다양하고 높은 성능을 보이는 아키텍처를 효과적으로 선택할 수 있는가?
- RQ4다양한 할당 함수(예: UCB 대비 EI)가 제안된 GP-TW 프레임워크에서 순차적 NAS 성능에 어떤 영향을 미치는가?
- RQ5고정된 월클럭 시간 예산 하에서 배치 크기가 제안된 병렬 NAS 방법의 성능에 어떤 영향을 미치는가?
주요 결과
- 제안된 트리-워샤르스타인(TW) 거리는 기존 최적 운반의 부정정의 성격을 극복하고, 가우시안 프로세스 모델에 대해 유효한 양의 준정의 커널을 가능하게 함.
- NASBench101 및 NASBench201에서 순차적 NAS에서 GP-TW 프레임워크가 베이스라인 방법을 능가하며, 평가 횟수를 줄이고도 더 높은 테스트 정확도를 달성함.
- k-DPP 기반 병렬 NAS 접근법은 NASBench101에서 여러 배치 크기에서 일관되게 최신 기술 수준의 성능을 달성하며, 정확도와 다양성 측면에서 뛰어남.
- TW 거리는 선형 시간 복잡도로 폐쇄형 계산이 가능하여, 특히 대규모 아키텍처에서 OT 기반 방법보다 훨씬 빠름.
- 제안된 NAS 프레임워크에서 GP-UCB 할당 함수가 GP-EI를 능가하며, Bananas와 같은 이전 벤치마크 결과와 일치함.
- 고정된 월클럭 예산 하에서 더 큰 배치 크기일수록 성능 향상이 관찰되어, k-DPP 기반 배치 선택 전략의 확장성과 효과성을 확인함.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.