Skip to main content
QUICK REVIEW

[논문 리뷰] NAS-Bench-NLP: Neural Architecture Search Benchmark for Natural Language Processing

Nikita Klyuchnikov, Ilya Trofimov|arXiv (Cornell University)|2020. 06. 12.
Multimodal Machine Learning Applications인용 수 12
한 줄 요약

이 논문은 순환 신경망(RNN) 기반으로 설계된 자연어 처리(NLP)를 위한 신경망 아키텍처 탐색(NAS) 벤치마크인 NAS-Bench-NLP를 소개한다. 언어 모델링 작업에 대해 훈련된 14,000개의 RNN 아키텍처에 대한 사전 계산된 성능 메트릭을 제공하여, 내재적(단어 유사도) 및 외재적(GLUE) 작업에서 재현 가능하고 효율적인 평가 및 NAS 알고리즘 벤치마킹을 가능하게 한다. 특히 LSTM 및 GRU 아키텍처가 일관되게 최상의 성능을 기록한다.

ABSTRACT

Neural Architecture Search (NAS) is a promising and rapidly evolving research area. Training a large number of neural networks requires an exceptional amount of computational power, which makes NAS unreachable for those researchers who have limited or no access to high-performance clusters and supercomputers. A few benchmarks with precomputed neural architectures performances have been recently introduced to overcome this problem and ensure more reproducible experiments. However, these benchmarks are only for the computer vision domain and, thus, are built from the image datasets and convolution-derived architectures. In this work, we step outside the computer vision domain by leveraging the language modeling task, which is the core of natural language processing (NLP). Our main contribution is as follows: we have provided search space of recurrent neural networks on the text datasets and trained 14k architectures within it; we have conducted both intrinsic and extrinsic evaluation of the trained models using datasets for semantic relatedness and language understanding evaluation; finally, we have tested several NAS algorithms to demonstrate how the precomputed results can be utilized. We believe that our results have high potential of usage for both NAS and NLP communities.

연구 동기 및 목표

  • NLP 분야에서 재현 가능하고 접근 가능한 NAS 벤치마크의 부족을 해결하기 위해, RNN 기반 아키텍처를 위한 사전 계산된 벤치마크를 구축한다.
  • 광범위한 훈련 자원이 필요 없이도 공정하고 효율적인 NAS 알고리즘 비교를 가능하게 한다.
  • 내재적(단어 임베딩) 및 외재적(GLUE) NLP 작업을 통해 아키텍처 성능을 평가한다.
  • 동일한 검색 공간에서 여러 NAS 알고리즘을 테스트하여 벤치마크의 유용성을 입증한다.
  • 모든 훈련된 아키텍처와 메트릭을 공개하여 커뮤니티 수준의 연구 및 모델 비교를 지원한다.

제안 방법

  • LSTM, GRU 및 기타 RNN 변종을 포함하는 새로운 RNN 유도 검색 공간을 정의하였으며, 연결성 및 셀 유형을 구성 가능하도록 설계하였다.
  • 표준 텍스트 데이터셋을 사용하여 언어 모델링 작업에 대해 14,000개의 고유한 아키텍처를 훈련시켰다.
  • 정적 단어 임베딩의 단어 유사도 테스트를 통해 내재적 평가를 수행하였다.
  • 하위 작업 GLUE 벤치마크 작업을 사용하여 외재적 평가를 수행하여 전이 성능를 평가하였다.
  • NAS 알고리즘 벤치마킹을 위해 훈련 월 타임, 검증 퍼플렉서티, 테스트 로그 퍼플렉서티를 측정할 수 있는 시뮬레이션 환경을 구현하였다.
  • 베이지안 최적화 및 기타 NAS 방법에서 사용할 수 있도록 아키텍처 그래프를 저차원 특징 공간으로 임bedding하기 위해 graph2vec를 사용하였다.

실험 결과

연구 질문

  • RQ1내재적 및 외재적 메트릭을 모두 활용하여 평가했을 때, RNN 기반 아키텍처는 다양한 NLP 작업에서 어떻게 성능을 발휘하는가?
  • RQ2대규모 RNN 검색 공간에서 사전 계산된 성능 데이터는 효과적이고 효율적인 NAS 알고리즘 벤치마킹을 가능하게 하는가?
  • RQ3검색 공간 내에서 무작위로 샘플링된 아키텍처에 비해 수작업으로 설계된 아키텍처(LSTM 및 GRU)는 전반적으로 어떻게 비교되는가?
  • RQ4성능가지가 다양한 언어 모델링 데이터셋 간에 얼마나 일반화되는가?
  • RQ5사전 계산된 메트릭을 사용한 시뮬레이션 NAS 환경에서, 다양한 NAS 알고리즘(Hyperband, 베이지안 최적화 등)의 성능는 어떻게 비교되는가?

주요 결과

  • 벤치마크에는 언어 모델링 및 하위 GLUE 작업에서 완전한 성능 메트릭을 갖춘 14,000개의 사전 훈련된 RNN 아키텍처를 포함한다.
  • LSTM 및 GRU 아키텍처는 일관되게 가장 낮은 테스트 로그 퍼플렉서티(L* = 4.36)를 기록하여 글로벌 수준에서 뛰어난 성능을 입증한다.
  • 다양한 데이터셋 간의 성능가지 높은 상관관계를 보이며, 한 데이터셋에서의 결과가 다른 데이터셋에서의 성능를 예측할 수 있음을 시사한다.
  • Hyperband는 NAS 알고리즘 벤치마킹에서 가장 낮은 최종 회귀를 기록하였고, 50D graph2vec 특징을 사용한 베이지안 최적화가 그 다음으로 뒤따랐다.
  • 퍼플렉서티 값의 분포가 최적에 치우쳐 있지 않음을 확인하여, 높은 성능를 갖는 아키텍처는 희귀하며 무작위 탐색으로 쉽게 발견되지 않는다는 점을 시사한다.
  • 벤치마크는 LSTM 및 GRU와 유사한 성능를 보이는 여러 가지 새로운 아키텍처를 발견하여, 새로운 효과적인 RNN 설계 가능성에 대한 시사점을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.