Skip to main content
QUICK REVIEW

[논문 리뷰] ES-ENAS: Combining Evolution Strategies with Neural Architecture Search at No Extra Cost for Reinforcement Learning.

Xingyou Song, Krzysztof Choromański|arXiv (Cornell University)|2021. 01. 19.
Reinforcement Learning in Robotics참고 문헌 49인용 수 9
한 줄 요약

ES-ENAS는 강화학습을 위한 새로운 NAS 방법을 제안하며, 진화전략(ES)과 효율적 NAS(ENAS)를 통합하여 중앙 집중형 집합기 안에 컨트롤러를 삽입함으로써 추가 비용 없이 가중치 공유를 구현한다. 이 방법은 연속 제어 과제에서 90% 이상의 모델 압축을 달성하여 자원 제약이 있는 모바일 로봇 플랫폼에서의 효율적 구현을 가능하게 한다.

ABSTRACT

We introduce ES-ENAS, a simple neural architecture search (NAS) algorithm for the purpose of reinforcement learning (RL) policy design, by combining Evolutionary Strategies (ES) and Efficient NAS (ENAS) in a highly scalable and intuitive way. Our main insight is noticing that ES is already a distributed blackbox algorithm, and thus we may simply insert a model controller from ENAS into the central aggregator in ES and obtain weight sharing properties for free. By doing so, we bridge the gap from NAS research in supervised learning settings to the reinforcement learning scenario through this relatively simple marriage between two different lines of research, and are one of the first to apply controller-based NAS techniques to RL. We demonstrate the utility of our method by training combinatorial neural network architectures for RL problems in continuous control, via edge pruning and weight sharing. We also incorporate a wide variety of popular techniques from modern NAS literature, including multiobjective optimization and varying controller methods, to showcase their promise in the RL field and discuss possible extensions. We achieve >90% network compression for multiple tasks, which may be special interest in mobile robotics with limited storage and computational resources.

연구 동기 및 목표

  • 컨트롤러 기반 NAS를 강화학습 설정에 적응시켜 지도학습 기반 NAS와 강화학습 간 격차를 메우기.
  • 진화전략의 분산적 특성을 활용하여 가중치 공유를 통해 강화학습에서 효율적인 신경망 아키텍처 탐색을 가능하게 하기.
  • 모바일 및 자원 제약이 있는 로봇 시스템에서의 구현을 지원하기 위해 강화학습 정책의 상당한 모델 압축을 달성하기.
  • 다양한 컨트롤러 방법과 다목적 최적화와 같은 현대적 NAS 기법들을 강화학습 환경에 통합해 보다 깊이 있는 탐색 가능성 탐색하기.
  • 연속 제어 과제에서 조합적 아키텍처를 학습하는 데 있어 ES와 ENAS를 결합한 방법의 타당성과 확장성을 입증하기.

제안 방법

  • 진화전략의 중앙 집중형 집합기에 ENAS의 컨트롤러를 통합하여 추가 계산 비용 없이도 가중치 공유를 가능하게 한다.
  • ES의 분산적이고 블랙박스 성격을 기반으로 컨트롤러를 통한 아키텍처 탐색을 자연스럽게 통합한다.
  • 엣지 프루닝과 가중치 공유를 활용하여 연속 제어 과제에 최적화된 조합적 신경망 아키텍처를 학습한다.
  • 지난해의 NAS 기법들인 다목적 최적화 및 다양한 컨트롤러 아키텍처를 강화학습 환경에 적응시킨다.
  • ES의 본질적 확장성 덕분에 큰 탐색 공간을 효율적으로 학습하고 탐색한다.
  • 컨트롤러 통합을 통해 아키텍처 탐색 기능을 도입하면서도 ES의 단순성과 병렬 처리 가능성은 그대로 유지한다.

실험 결과

연구 질문

  • RQ1진화전략은 추가 비용 없이 강화학습 환경에서 신경망 아키텍처 탐색을 효과적으로 확장할 수 있는가?
  • RQ2추가 계산 비용 없이 ES 기반 강화학습 학습에 가중치 공유를 자연스럽게 통합할 수 있는가?
  • RQ3지도학습에서 개발된 컨트롤러 기반 NAS 기법들이 강화학습 환경에 얼마나 잘 적응할 수 있는가?
  • RQ4제안된 ES-ENAS 프레임워크를 통해 강화학습 정책에서 얼마나 높은 수준의 모델 압축을 달성할 수 있는가?
  • RQ5다목적 최적화 및 다양한 컨트롤러와 같은 현대적 NAS 기법들이 강화학습 아키텍처 탐색에 적용되었을 때 성능은 어떠한가?

주요 결과

  • ES-ENAS는 ES와 ENAS를 결합하여 강화학습 환경에서 효과적인 신경망 아키텍처 탐색을 가능하게 하며, 내장된 가중치 공유 덕분에 높은 효율성 향상을 달성한다.
  • 이 방법은 연속 제어 과제에서 신경망 아키텍처의 90% 이상을 압축하여 모델 크기와 계산 요구량을 감소시킨다.
  • ENAS 스타일의 컨트롤러를 ES에 통합하는 것은 원활하며 추가 비용 없이도 이루어지므로 원래 ES 프레임워크의 확장성은 그대로 유지된다.
  • 이 접근법은 다목적 최적화 및 다양한 컨트롤러 설계와 같은 고급 NAS 기법들을 강화학습 환경에 적용하는 데에도 유용하다.
  • 이 프레임워크는 저장소와 계산 자원이 제한된 모바일 로봇에서의 구현 잠재력을 높게 보여준다.
  • 결과적으로 컨트롤러 기반 NAS가 지도학습에서 강화학습으로의 이행이 최소한의 수정으로도 성공적으로 가능함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.