Skip to main content
QUICK REVIEW

[논문 리뷰] AceNAS: Learning to Rank Ace Neural Architectures with Weak Supervision of Weight Sharing.

Yuge Zhang, Chenqian Yan|arXiv (Cornell University)|2021. 08. 06.
Advanced Image and Video Retrieval Techniques참고 문헌 58인용 수 5
한 줄 요약

AceNAS는 신경망 아키텍처 탐색(NAS)을 위한 랜킹 학습(LTR) 프레임워크를 도입하며, 최적화 목표로 NDCG를 사용하고, 훈련에 LambdaRank를 적용한다. 가중치 공유를 통한 약한 지도 학습을 활용해 검색 비용을 줄인다. 슈퍼넷의 약한 레이블을 기반으로 아키텍처 표현을 사전학습하고, 정확도 측정값이 적은 소규모 데이터셋에서 미세조정함으로써 고가의 훈련 런 수를 크게 줄이며 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Architecture performance predictors have been widely used in neural architecture search (NAS). Although they are shown to be simple and effective, the optimization objectives in previous arts (e.g., precise accuracy estimation or perfect ranking of all architectures in the space) did not capture the ranking nature of NAS. In addition, a large number of ground-truth architecture-accuracy pairs are usually required to build a reliable predictor, making the process too computationally expensive. To overcome these, in this paper, we look at NAS from a novel point of view and introduce Learning to Rank (LTR) methods to select the best (ace) architectures from a space. Specifically, we propose to use Normalized Discounted Cumulative Gain (NDCG) as the target metric and LambdaRank as the training algorithm. We also propose to leverage weak supervision from weight sharing by pretraining architecture representation on weak labels obtained from the super-net and then finetuning the ranking model using a small number of architectures trained from scratch. Extensive experiments on NAS benchmarks and large-scale search spaces demonstrate that our approach outperforms SOTA with a significantly reduced search cost.

연구 동기 및 목표

  • 기존 NAS 최적화 목표와 아키텍처 선택의 랜킹 성격 간의 괴리 문제를 해결한다.
  • 성능 예측기 훈련에 필요한 대규모 진정 정답 정확도 쌍에 대한 의존도를 줄여 고비용 훈련 런 수를 감소시킨다.
  • 슈퍼넷의 가중치 공유를 통해 아키텍처 표현의 사전학습을 위한 약한 레이블을 활용한다.
  • 약한 지도 학습과 소규모 정확한 훈련 결과에서의 미세조정을 조합해 최소한의 지도 학습으로도 효과적인 아키텍처 랜킹을 가능하게 한다.
  • 기존 방법에 비해 훨씬 낮은 검색 비용으로 NAS에서 최신 기술 수준(SOTA) 성능을 달성한다.

제안 방법

  • 아키텍처 공간에서의 랜킹 성격을 고려해 NAS를 랜킹 학습(LTR) 문제로 재정의하고, 주요 최적화 지표로 정규화된 할인 누적 수익(NDCG)를 사용한다.
  • 아키텍처 공간 전반의 랜킹 품질을 직접 최적화하기 위해 LambdaRank 알고리즘을 적용해 랜킹 모델을 훈련시킨다.
  • 슈퍼넷의 성능에서 유도된 약한 레이블을 사용해 아키텍처 표현 모델을 사전학습함으로써 효율적인 초기화를 가능하게 한다.
  • 정확도가 높은 소규모 커리티드 아키텍처 집합에서 다시 훈련한 결과를 기반으로 랜킹 모델을 미세조정하여 정확도와 랜킹 정밀도를 향상시킨다.
  • 신경망을 사용해 아키텍처를 연속적인 표현 공간에 매핑함으로써 효과적인 비교 및 랜킹을 가능하게 한다.
  • 사전학습과 미세조정 파이프라인을 통합해 아키텍처 선택의 효율성과 정확도를 균형 잡는다.

실험 결과

연구 질문

  • RQ1랜킹 학습 기법을 활용하면 아키텍처 탐색 문제의 랜킹 성격과 더 잘 부합함으로써 효율성과 효과성을 향상시킬 수 있는가?
  • RQ2슈퍼넷 내 가중치 공유를 통한 약한 지도 학습은 얼마나 많은 고비용 진정 정답 정확도 레이블이 필요한지 줄일 수 있는가?
  • RQ3약한 레이블에 대한 사전학습과 소규모 정확한 결과에 대한 미세조정의 조합이 최종 랜킹 성능과 검색 비용에 어떤 영향을 미치는가?
  • RQ4최적화 목표로 NDCG를 사용할 경우, 기존의 회귀나 분류 목표에 비해 상위-k 아키텍처 선택 성능이 향상되는가?
  • RQ5제안된 방법은 상당히 낮은 계산 비용으로 NAS 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성할 수 있는가?

주요 결과

  • AceNAS는 여러 NAS 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, 정확도와 효율성 측면에서 기존 방법을 능가한다.
  • 효율적인 약한 지도 학습 활용 덕분에 고가의 훈련 런 수를 극도로 줄여 검색 비용을 크게 감소시켰다.
  • 슈퍼넷의 약한 레이블에 기반한 사전학습 덕분에 모델이 잘 일반화되어 광범위한 레이블 데이터가 필요로 하지 않는다.
  • 정확히 훈련된 소규모 아키텍처 집합에서의 미세조정은 랜킹 정밀도와 최종 아키텍처 성능에 상당한 향상을 이끌어냈다.
  • NDCG와 LambdaRank를 최적화 목표로 사용함으로써 기존의 정확도 추정 방법에 비해 더 나은 상위-k 아키텍처 선택 성능을 달성했다.
  • 대규모 검색 공간에서도 강력한 확장성을 보이며, 최소한의 계산 오버헤드로 높은 성능을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.