Skip to main content
QUICK REVIEW

[논문 리뷰] From Complexity to Simplicity: Adaptive ES-Active Subspaces for Blackbox Optimization

Krzysztof Choromański, Aldo Pacchiano|arXiv (Cornell University)|2019. 03. 07.
Advanced Bandit Algorithms Research인용 수 9
한 줄 요약

이 논문은 활성 부분공간과 압축 측정을 사용하여 최적의 감지 방향을 동적으로 학습하는 새로운 적응형 진화 전략인 ASEBO를 소개한다. 고차원 함수의 내재 차원성과 기하학적 구조에 지속적으로 적응함으로써, 외부 감독 없이 강화학습 및 벤치마크 최적화 작업에서 쿼리 횟수를 줄이며 기존 최고 수준의 방법들보다 뛰어난 샘플 효율성을 달성한다.

ABSTRACT

We present a new algorithm ASEBO for optimizing high-dimensional blackbox functions. ASEBO adapts to the geometry of the function and learns optimal sets of sensing directions, which are used to probe it, on-the-fly. It addresses the exploration-exploitation trade-off of blackbox optimization with expensive blackbox queries by continuously learning the bias of the lower-dimensional model used to approximate gradients of smoothings of the function via compressed sensing and contextual bandits methods. To obtain this model, it leverages techniques from the emerging theory of active subspaces in the novel ES blackbox optimization context. As a result, ASEBO learns the dynamically changing intrinsic dimensionality of the gradient space and adapts to the hardness of different stages of the optimization without external supervision. Consequently, it leads to more sample-efficient blackbox optimization than state-of-the-art algorithms. We provide theoretical results and test ASEBO advantages over other methods empirically by evaluating it on the set of reinforcement learning policy optimization tasks as well as functions from the recently open-sourced Nevergrad library.

연구 동기 및 목표

  • 함수 평가가 비용이 많이 드는 고차원 환경에서 블랙박스 최적화의 높은 샘플 복잡도를 해결하기 위해.
  • 진화 전략에서 고정된 방향 또는 고정된 차원성 방법의 한계를 극복하기 위해 함수 기하학에 동적으로 적응할 수 있도록 하기 위해.
  • 압축 측정과 컨텍스트 밴디트를 사용해 온라인으로 기울기 근사 편향을 학습함으로써, 도함수 없는 최적화에서 탐색과 이용의 균형을 향상시키기 위해.
  • 비-MDP 및 비미분 가능 작업을 포함한 다양한 블랙박스 함수에 대해 강건하고 샘플 효율적인 최적화를 가능하게 하기 위해.
  • 수동적인 하이퍼파rameter 튜닝에 의존도를 줄이기 위해 실시간으로 최적의 감지 부분공간을 학습하기 위해.

제안 방법

  • ASEBO는 함수의 변동이 가장 두드러지는 저차원 부분공간을 식별하기 위해 활성 부분공간 이론을 활용하여 효율적인 기울기 근사화를 가능하게 한다.
  • 압축 측정을 사용하여, 적응형 감지 방향을 따라 임의의 투영을 통해 스무스한 블랙박스 함수의 기울기를 추정한다.
  • 알고리즘은 과거 성능에 기반해 감지 방향을 동적으로 선택함으로써 탐색과 이용의 균형을 이루는 컨텍스트 밴디트를 활용한다.
  • 지속적으로 기울기 공간의 저차원 모델을 업데이트하며, 최적화 과정 내내 함수 기하학의 내재 차원성을 학습한다.
  • ASEBO는 기울기가 강한 부분공간(활성 부분공간)과 그 수직보완부분공간을 별도로 추정하며, 농도 불확실성 부등식을 사용해 강건성을 확보한다.
  • 관측된 신호 강도에 따라 감지 방향의 수를 적응적으로 조정함으로써 고정되거나 사전에 지정된 부분공간을 피한다.

실험 결과

연구 질문

  • RQ1활성 부분공간이 고차원 블랙박스 최적화에서 샘플 효율성을 향상시키기 위해 진화 전략에 효과적으로 통합될 수 있는가?
  • RQ2사전 지식 없이 최적화 과정 중에 블랙박스 함수의 내재 차원성을 어떻게 동적으로 학습할 수 있는가?
  • RQ3압축 측정과 컨텍스트 밴디트가 도함수 없는 최적화에서 기울기 근사에 얼마나 기여할 수 있는가?
  • RQ4ASEBO는 다양한 최적화 작업에서 고정된 하이퍼파rameter를 가진 지도 기반 ES 방법과 CMA-ES 변종보다 쿼리 효율성이 뛰어나게 성능을 높이는가?
  • RQ5ASEBO는 구조적 가정 없이 비-MDP 및 비미분 가능 블랙박스 함수에 일반화될 수 있는가?

주요 결과

  • ASEBO는 강화학습 정책 최적화 작업에서 기존 최고 수준의 방법들보다 유의미하게 낮은 쿼리 횟수를 기록하며 뛰어난 샘플 효율성을 입증한다.
  • 알고리즘은 최적화 단계 동안 함수 복잡도의 변화에 따라 기울기 공간의 내재 차원성을 동적으로 학습한다.
  • Nevergrad 벤치마크 라이브러리에서의 실험 결과, CMA-ES, ARS 및 기타 지도 기반 ES 변종보다 일관된 성능 향상을 보였다.
  • 실시간으로 최적의 감지 방향을 학습함으로써 수동적인 하이퍼파rameter 튜닝에 대한 의존도를 줄였으며, 고정된 버퍼 길이 또는 고정된 부분공간을 가진 방법들보다 뛰어난 성능을 보였다.
  • 이론적 분석을 통해 ASEBO의 기울기 근사 오차는 높은 확률로 유계임을 확인하였으며, 이는 강건성과 수렴 성질을 뒷받침한다.
  • 압축 측정과 컨텍스트 밴디트가 고차원 및 비스무스한 영역에서 효과적인 탐색-이용 균형을 실현한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.