Skip to main content
QUICK REVIEW

[논문 리뷰] Stochastic Variational Optimization

Thomas Bird, Julius Kunze|arXiv (Cornell University)|2018. 09. 13.
Metaheuristic Optimization Algorithms Research참고 문헌 9인용 수 15
한 줄 요약

이 논문은 비미분 가능하거나 이산적인 목표 함수를 위한 미분 가능한 상한으로 Stochastic Variational Optimization (SVO)를 제안하며, Gaussian Perturbation와 Natural Evolution Strategies와 같은 방법들이 SVO의 특수한 경우임을 보여준다. 이는 가우시안 샘플링을 사용하는 경우를 의미한다. 또한, 목표 함수가 미분 가능할 경우 Stochastic Directional Derivatives가 훨씬 낮은 분산을 가지므로 SVO 기반 방법보다 우수한 성능을 보이며, 병렬화 가능한 확률적 경사하강법에 더 적합하다고 한다.

ABSTRACT

Variational Optimization forms a differentiable upper bound on an objective. We show that approaches such as Natural Evolution Strategies and Gaussian Perturbation, are special cases of Variational Optimization in which the expectations are approximated by Gaussian sampling. These approaches are of particular interest because they are parallelizable. We calculate the approximate bias and variance of the corresponding gradient estimators and demonstrate that using antithetic sampling or a baseline is crucial to mitigate their problems. We contrast these methods with an alternative parallelizable method, namely Directional Derivatives. We conclude that, for differentiable objectives, using Directional Derivatives is preferable to using Variational Optimization to perform parallel Stochastic Gradient Descent.

연구 동기 및 목표

  • 비미분 가능하거나 이산적인 목표 함수 최적화를 위한 원리적인, 미분 가능한 상한으로 Stochastic Variational Optimization (SVO)를 체계화하는 것.
  • Gaussian Perturbation (GP) 기울기 추정기의 편향과 분산을 분석하여, 분산이 높아 편향 보정 없이선 실용성이 떨어짐을 보여주는 것.
  • 반대칭 샘플링과 기준선 방법이 GP 추정기의 분산을 줄이는 데 얼마나 효과적인지 평가하여, 훈련 안정성 확보에 있어 이들의 핵심적인 역할을 입증하는 것.
  • SVO 기반 방법과 병렬화 가능한 대안 기반 기울기 추정기인 Directional Derivatives (DD)를 비교하여, 특히 목표 함수가 미분 가능할 경우의 성능을 분석하는 것.
  • 목표 함수가 미분 가능할 경우 DD가 SVO보다 분산이 낮고 노이즈 스케일 하이퍼파rameter 조정이 필요 없어 더 바람직하다는 것을 입증하는 것.

제안 방법

  • SVO를 상한 $ U(\theta) = \mathbb{E}_{p(x|\theta)}[f(x)] $ 를 최소화하는 방식으로 정식화하며, 여기서 $ \theta $ 는 변분 분포 $ p(x|\theta) $ 를 매개변수화한다. 이를 통해 미분 가능한 최적화를 가능하게 한다.
  • Monte Carlo 샘플링을 적용하여 $ U(\theta) $ 의 기울기 근사를 도출하며, $ \nabla_\theta U \approx \frac{1}{S} \sum_{s=1}^S f(x^s) \nabla_\theta \log p(x^s|\theta) $ 를 얻는다. 여기서 $ x^s \sim p(x|\theta) $ 이다.
  • 변분 분포를 가우시안으로 설정하여 SVO를 가우시안 펌프팅에 특화시키며, 이는 $ p(x|\theta) = \mathcal{N}(\mu, \sigma^2 I) $ 를 의미한다. 이 경우 GP 추정기 $ \nabla_\mu U = \frac{1}{\sigma^2} \mathbb{E}_\epsilon [\epsilon f(\mu + \epsilon)] $ 를 도출한다.
  • 반대칭 샘플링을 도입하여 GP 추정기의 분산을 줄이며, 이를 위한 분산 감소의 분석적 표현을 유도한다.
  • 이동 평균 기준선을 사용하여 GP 추정기의 분산을 추가로 감소시키며, 반대칭 샘플링과 유사한 성능을 달성함을 보여준다.
  • 기타 대안으로 Stochastic Directional Derivative (DD) 추정기를 제안하고 분석하며, 이는 방향성 펌프팅을 통한 기울기 계산을 통해 노이즈 스케일 하이퍼파rameter가 필요 없음을 보여준다.

실험 결과

연구 질문

  • RQ1Stochastic Variational Optimization (SVO)는 기존의 진화적 또는 기울기 근사 방법들인 Gaussian Perturbation과 Natural Evolution Strategies와 어떻게 관련이 있는가?
  • RQ2Gaussian Perturbation 기울기 추정기의 편향과 분산 특성은 무엇이며, 반대칭 샘플링과 기준선은 이들에 어떻게 영향을 미치는가?
  • RQ3반대칭 샘플링을 적용한 GP 추정기의 성능은 SPSA 기울기 추정기와 어떻게 비교되는가?
  • RQ4목표 함수가 미분 가능할 경우, SVO 기반 방법보다 분산과 안정성 측면에서 뛰어난 병렬화 가능한 기울기 추정기가 존재하는가?
  • RQ5Stochastic Directional Derivatives는 가우시안 펌프팅 기반 SVO의 대안으로서 하이퍼파rameter가 없고 분산이 낮은 방법을 제공할 수 있는가?

주요 결과

  • Gaussian Perturbation (GP) 추정기는 변분 분포가 가우시안일 경우 SVO의 특수한 경우이며, 반대칭 샘플링 또는 기준선 없이선 높은 분산을 가지므로 실용성이 떨어진다.
  • 반대칭 샘플링은 GP 추정기의 분산을 크게 줄이며 편향에 영향을 주지 않으며, 유도된 분석적 표현을 통해 분산 감소가 잘 근사됨을 보여준다.
  • GP 추정기에서 기준선을 사용하면 반대칭 샘플링과 유사한 분산 감소 효과를 얻을 수 있으며, 적절한 튜닝이 이루어지면 실용적인 성능을 달성할 수 있다.
  • 반대칭 샘플링을 적용한 GP 추정기는 SPSA 기울기 추정기와 유사한 편향과 분산 특성을 공유하며, 밀접한 유사성을 가진다.
  • 목표 함수가 미분 가능할 경우 Stochastic Directional Derivative (DD) 추정기는 표준 GP보다 훨씬 낮은 분산을 가지며, 반대칭 샘플링을 적용한 GP보다도 합성 및 신경망 실험에서 뛰어난 성능을 보인다.
  • MNIST 데이터셋에서 3층 완전 연결 신경망을 훈련한 결과, DD 방법은 반대칭 샘플링 없이 GP를 사용한 경우보다 더 뛰어난 수렴 성능과 낮은 손실을 달성하였으며, 반대칭 샘플링을 적용한 GP와 비교해도 성능을 뒤지지 않았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.