Skip to main content
QUICK REVIEW

[논문 리뷰] A Semi-Supervised Assessor of Neural Architectures

Yehui Tang, Yunhe Wang|arXiv (Cornell University)|2020. 05. 14.
Anomaly Detection Techniques and Applications참고 문헌 46인용 수 11
한 줄 요약

이 논문은 신경망 아키텍처 검색(NAS)에서 성능 예측을 향상시키기 위해 라벨이 붙은 및 라벨이 없는 신경망 아키텍처를 모두 활용하는 준지도 학습 평가자(semi-supervised assessor)를 제안한다. 자동에코더를 사용해 의미 있는 아키텍처 표현을 학습하고, 라벨이 붙은 및 라벨이 없는 아키텍처들로 구성된 그래프에서 그래프 컨volution 네트워크(GCN)를 적용함으로써, 완전히 훈련된 아키텍처에 대한 의존도를 줄인다. 이로 인해 NAS-Bench-101에서 라벨이 붙은 아키텍처가 1,000개 뿐이어도 상위 1위 정확도가 94.01%에 도달한다.

ABSTRACT

Neural architecture search (NAS) aims to automatically design deep neural networks of satisfactory performance. Wherein, architecture performance predictor is critical to efficiently value an intermediate neural architecture. But for the training of this predictor, a number of neural architectures and their corresponding real performance often have to be collected. In contrast with classical performance predictor optimized in a fully supervised way, this paper suggests a semi-supervised assessor of neural architectures. We employ an auto-encoder to discover meaningful representations of neural architectures. Taking each neural architecture as an individual instance in the search space, we construct a graph to capture their intrinsic similarities, where both labeled and unlabeled architectures are involved. A graph convolutional neural network is introduced to predict the performance of architectures based on the learned representations and their relation modeled by the graph. Extensive experimental results on the NAS-Benchmark-101 dataset demonstrated that our method is able to make a significant reduction on the required fully trained architectures for finding efficient architectures.

연구 동기 및 목표

  • NAS에서 아키텍처 성능 예측을 위해 대규모로 완전히 훈련된 라벨이 붙은 데이터셋에 대한 의존도를 줄이기 위해.
  • 수많은 수의 라벨이 없는 신경망 아키텍처들 간의 내재된 유사성을 활용하여 예측기의 일반화 능력을 향상시키기 위해.
  • 라벨이 붙은 및 라벨이 없는 데이터를 함께 사용하여 아키텍처 표현을 공동으로 학습하고 성능을 예측하는 종단 간 훈련 가능한 프레임워크를 개발하기 위해.
  • 높은 성능을 보이는 아키텍처를 식별하기 위해 필요한 고비용의 완전한 훈련 런 수를 최소화하기 위해.

제안 방법

  • 모든 아키텍처 검색 공간에서 자동에코더를 훈련시어 신경망 아키텍처의 압축되고 의미 있는 표현을 학습한다.
  • 노드는 아키텍처를 나타내고, 간선은 자동에코더 임베딩 기반으로 학습된 유사성을 표현하는 그래프를 구성하며, 이는 라벨이 붙은 및 라벨이 없는 아키텍처를 모두 포함한다.
  • 그래프 컨볼루션 네트워크(GCN)를 사용하여 이웃 아키텍처들의 표현과 관계 정보를 집계함으로써 성능을 예측한다.
  • 라벨이 붙은 아키텍처에 대한 회귀 손실과 자동에코더에 대한 재구성 손실을 조합한 손실을 사용해 전체 시스템을 종단 간으로 훈련한다.
  • 스케일 인자 σ는 그래프 구축 시 유사성 측정의 민감도를 제어하며, λ는 재구성 손실과 회귀 손실 간의 균형을 조절한다.

실험 결과

연구 질문

  • RQ1NAS 검색 공간 내의 라벨이 없는 아키텍처들이 최소한의 라벨 데이터로 성능 예측을 향상시키는 데 효과적으로 활용될 수 있는가?
  • RQ2아키텍처 유사성을 그래프 구조를 통해 통합할 경우, 완전히 지도 학습 기반 대비 예측 정확도가 어떻게 향상되는가?
  • RQ3자동에코더를 통한 표현 학습이 성능 예측을 위한 아키텍처 임베딩의 품질을 어느 정도 향상시키는가?
  • RQ4성능 예측 정확도와 계산 효율성 측면에서, 라벨이 붙은 데이터와 라벨이 없는 데이터 사이의 최적의 트레이드오프는 무엇인가?

주요 결과

  • 제안된 방법은 NAS-Bench-101에서 라벨이 붙은 아키텍처가 1,000개 뿐이어도 상위 1위 정확도가 94.01%에 도달하여 검색 공간의 상위 0.01%에 속한다.
  • 라벨이 붙은 아키텍처가 10,000개일 경우, 메소드는 켄달 타우 상관계수 0.7814를 기록하며, 완전히 지도 학습 기반 대비 유의미하게 높은 성능을 보였다 (0.7188).
  • 재구성 손실(λ > 0)이 포함될 경우 예측 정확도가 향상되며, 이는 라벨이 없는 데이터가 표현 학습을 향상시킨다는 것을 입증한다.
  • 라벨이 없는 아키텍처의 수를 늘릴수록(최대 50,000개까지) 예측 성능이 향상되며, 그 이상이 되면 수익 감소 현상이 나타난다.
  • 라벨이 붙은 아키텍처가 1,000개 뿐일 경우 자동에코더가 예측 정확도를 23.4% 향상시켰다 (Ktau 0.5302에서 0.6541로). 이는 표현 학습의 효과성을 보여준다.
  • 기존 NAS 대비 전체 훈련 런 수를 90% 이상 줄여 계산 비용을 크게 감소시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.