Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Search Space Partition for Black-box Optimization using Monte Carlo Tree Search

Linnan Wang, Rodrigo Fonseca|arXiv (Cornell University)|2020. 07. 01.
Advanced Bandit Algorithms Research참고 문헌 55인용 수 31
한 줄 요약

LA-MCTS는 블랙박스 최적화를 위한 비선형 공간 분할을 배우는 메타-알고리즘이며, 선택된 영역 내에서 BO를 사용하여 샘플 효율성을 향상시키고 특히 고차원 문제에서 성능을 개선합니다.

ABSTRACT

High dimensional black-box optimization has broad applications but remains a challenging problem to solve. Given a set of samples $\{\vx_i, y_i\}$, building a global model (like Bayesian Optimization (BO)) suffers from the curse of dimensionality in the high-dimensional search space, while a greedy search may lead to sub-optimality. By recursively splitting the search space into regions with high/low function values, recent works like LaNAS shows good performance in Neural Architecture Search (NAS), reducing the sample complexity empirically. In this paper, we coin LA-MCTS that extends LaNAS to other domains. Unlike previous approaches, LA-MCTS learns the partition of the search space using a few samples and their function values in an online fashion. While LaNAS uses linear partition and performs uniform sampling in each region, our LA-MCTS adopts a nonlinear decision boundary and learns a local model to pick good candidates. If the nonlinear partition function and the local model fits well with ground-truth black-box function, then good partitions and candidates can be reached with much fewer samples. LA-MCTS serves as a \emph{meta-algorithm} by using existing black-box optimizers (e.g., BO, TuRBO) as its local models, achieving strong performance in general black-box optimization and reinforcement learning benchmarks, in particular for high-dimensional problems.

연구 동기 및 목표

  • 학습된 공간 분할을 통해 과도한 탐색을 피함으로써 고차원 블랙박스 최적화를 다룬다.
  • 유망한 영역에 샘플링을 집중시키기 위해 계층적 분할 전략을 활용한다.
  • 학습된 분할 내에 로컬 최적화기(TuRBO 또는 BO 등)를 통합하여 샘플 효율성을 향상시킨다.
  • MuJoCo RL 벤치마크와 합성 함수 전반에서 효과를 입증한다.
  • 초매개변수 및 분할 전략의 영향력을 이해하기 위한 제거 실험(ablation)을 제시한다.

제안 방법

  • 현재 샘플로부터 학습된 잠재 행동(latent actions)을 통해 재귀적으로 분할하는 각 노드가 탐색 공간의 영역을 나타내는 트리를 구성한다.
  • 노드 내부에서 샘플을 함수 값으로 K-means로 군집화하여 좋은 영역과 나쁜 영역을 식별하고, 분할을 위한 비선형 경계(잠재 행동)를 형성하도록 SVM을 학습시킨다.
  • 탐색과 활용의 균형을 맞추기 위해 UCB를 사용해 경로를 선택하고, 유망한 리프에 샘플을 집중한다.
  • 선택된 영역에서 잠재 행동 경계의 경로로 정의된 영역으로 제약하면서 로컬 해석기(TuRBO 또는 BO)로 f를 최적화한다.
  • 샘플 수가 임계치를 초과하면 리프를 반복적으로 분할하여 유망한 영역에서 탐색을 심화하고 시간이 지남에 따라 v* 추정치를 정제한다.
  • 제한된 영역(Omega_selected) 내부의 샘플링 전략을 제공하고 해당 영역에 TuRBO 초기화를 맞춰 견고한 탐색을 보장한다.

실험 결과

연구 질문

  • RQ1고정된 분할 방법과 비교하여 학습된 비선형 공간 분할이 고차원 블랙박스 최적화에서 샘플 효율성을 향상시킬 수 있는가?
  • RQ2적응적으로 학습된 영역 내에 로컬 베이지안 최적화기를 통합하는 것이 독립형 BO나 진화 알고리즘(EA) 방법보다 우수한가?
  • RQ3하이퍼파라미터(C_p, 커널 선택, 분할 임계값)가 작업 전반에 걸쳐 LA-MCTS의 성능에 어떤 영향을 미치는가?
  • RQ4일반 메타-옵티마이저로서 LA-MCTS가 MuJoCo RL 작업, 궤적 최적화, 합성 벤치마크 등 다양한 영역에서 강건한가?

주요 결과

  • LA-MCTS는 MuJoCo 보행 작업에서 최첨단 기준선(TuRBO, HesBO, BOHB, CMA-ES, DE, DOO, SOO, VOO)을 지속적으로 능가하며, 차원이 증가할수록 그 우수성이 두드러진다.
  • 학습된 비선형 분할과 UCB 기반 노드 선택이 집중 탐색을 가능하게 해 과도한 탐색을 줄이고 고차원 문제에서 샘플 효율성을 향상시킨다.
  • TuRBO와 결합되면 LA-MCTS가 성능을 크게 향상시키고 재시작 전반에 걸쳐 유망한 영역으로부터 더 나은 초기화를 제공한다.
  • LA-MCTS는 고차원에서의 기울기 기반 베이지안 최적화도 향상시키며 Ackley와 Rosenbrock 같은 합성 함수에서의 성능을 개선한다.
  • 제거 연구는 탐색이 결정적임(Cp), 커널 선택(SVM), 분할 임계값(theta)이 결과에 상당한 영향을 미친다는 것을 보여주며, 적절한 임계값으로 더 깊은 트리는 큰 공간에서 도움이 된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.