Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Guide Random Search

Ozan Şener, Vladlen Koltun|arXiv (Cornell University)|2020. 04. 25.
Advanced Bandit Algorithms Research참고 문헌 39인용 수 5
한 줄 요약

이 논문은 고차원 비미분 최적화 문제에서 무작위 탐색을 지도하는 온라인 다양체 학습 방법을 제안한다. 이 방법은 목적 함수의 바닥에 깔린 저차원 다양체를 탐지하고 이용하기 위해 신경망을 적응시킨다. 다각도로 다양체를 학습하고 목적 함수를 최적화함으로써, 기존의 최상위 알고리즘인 증강 무작위 탐색(Augmented Random Search), 베이지안 최적화, CMA-ES보다 샘플 복잡도가 크게 감소하여 성능을 뛰어넘는다. 이는 연속 제어 문제와 벤치마크 문제에서 입증되었다.

ABSTRACT

We are interested in derivative-free optimization of high-dimensional functions. The sample complexity of existing methods is high and depends on problem dimensionality, unlike the dimensionality-independent rates of first-order methods. The recent success of deep learning suggests that many datasets lie on low-dimensional manifolds that can be represented by deep nonlinear models. We therefore consider derivative-free optimization of a high-dimensional function that lies on a latent low-dimensional manifold. We develop an online learning approach that learns this manifold while performing the optimization. In other words, we jointly learn the manifold and optimize the function. Our analysis suggests that the presented method significantly reduces sample complexity. We empirically evaluate the method on continuous optimization benchmarks and high-dimensional continuous control problems. Our method achieves significantly lower sample complexity than Augmented Random Search, Bayesian optimization, covariance matrix adaptation (CMA-ES), and other derivative-free optimization algorithms.

연구 동기 및 목표

  • 고차원 문제에서 비미분 최적화(DFO)의 높은 샘플 복잡도 문제를 해결하기 위해, 차원 수가 증가함에 따라 성능이 급격히 떨어지는 문제를 해결한다.
  • 낮은 내재 차원성을 가진 고차원 데이터가 비미분 최적화에서 샘플 복잡도를 줄이는 데 활용될 수 있는지 탐색한다.
  • 사전에 다양체에 대한 지식이 없이도, 저차원 다양체를 적응적으로 온라인으로 동시에 학습하고 최적화를 수행하는 방법을 개발한다.
  • 변화하는 신경망으로 학습된 다양체의 탄성 공간에 탐색 방향을 투영함으로써, 무작위 탐색의 효율성을 향상시킨다.
  • 기울기가 없는 환경에서도 일阶 방법과 유사한 차원 독립적 수렴 속도를 달성한다.

제안 방법

  • 이 방법은 고차원 탐색 공간 내에서 저차원 잠재 다양체를 파arameter화하기 위해 딥 신경망을 사용하며, 이로 인해 낮은 차원 공간에서 최적화가 가능해진다.
  • 무작위 탐색을 학습된 다양체의 탄성 공간에서 수행하도록 확장하며, 기울기 추정기의 분산을 줄이기 위해 반대성 샘플링을 사용한다.
  • 함수 평가를 이용해 다양체의 탄성 공간에서 기울기를 추정함으로써, 스토하스틱 경사 하강법과 관성 항을 사용해 다양체 파라미터를 온라인으로 업데이트한다.
  • 초기화 조건이 만족되지 않으면, 편미분 크기가 1e-6 이하일 때마다 재초기화를 수행하며, δ(편미분 크기), k(다양체 차원 수), α(학습률)에 대한 격자 탐색을 수행한다.
  • Flaxman 등(2005)이 제안한 부드러운 기울기 추정기의 변형을 사용하며, 탄성 공간에서 방향 샘플링을 통해 다양체에 적응시킨다.
  • 다양체 아키텍처는 ReLU 활성화 함수를 사용하는 다층 퍼셉트론이며, d < 1000과 d > 1000에 대해 각각 다른 깊이와 너비 설정을 사용한다.

실험 결과

연구 질문

  • RQ1고차원 문제에서 온라인으로 저차원 다양체를 학습함으로써 비미분 최적화의 샘플 복잡도를 줄일 수 있는가?
  • RQ2비선형이며 신경망 기반의 다양체 표현 방식이 비선형 부분공간 방법보다 비미분 최적화에서 더 우수한 성능을 내는가?
  • RQ3최적화와 다양체 학습을 동시에 수행함으로써, 표준 무작위 탐색이나 베이지안 최적화보다 더 빠른 수렴 속도를 달성할 수 있는가?
  • RQ4이 방법은 다양한 연속 최적화 벤치마크와 고차원 제어 과제에서 어떻게 성능을 내는가?
  • RQ5이러한 방법의 샘플 복잡도는 일阶 방법과 마찬가지로 환경 차원에 영향을 받지 않는가?

주요 결과

  • 이 논문에서 제안한 방법은 연속 제어 및 최적화 벤치마크 문제에서 증강 무작위 탐색(ARS), 베이지안 최적화, CMA-ES 및 기타 DFO 기준선보다 샘플 복잡도가 크게 낮다.
  • 낮은 차원의 비제약 최적화 벤치마크(46개 문제, d=10 및 d=100)에서, 함수 평가 효율성 측면에서 모든 기준선을 능가한다.
  • MuJoCo 연속 제어 과제에서, 환경 상호작용 횟수가 적을수록 더 높은 수익을 얻는다. 이는 ARS, CMA-ES, 베이지안 최적화보다 뛰어난 성능을 보였다.
  • 에어포일 형상 최적화 실험 결과, 기준선 방법보다 더 우수한 성능을 내는 설계를 더 적은 함수 평가 수로 도출하였다.
  • 이론적 분석을 통해, 문제의 낮은 내재 차원성을 활용함으로써 샘플 복잡도가 감소함을 확인하였다.
  • 노이즈가 있는, 비凸성 및 비분리 함수를 포함한 다양한 문제 유형에서도 성능 유지로 인해 강건함을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.