Skip to main content
QUICK REVIEW

[논문 리뷰] Random Search Hyper-Parameter Tuning: Expected Improvement Estimation and the Corresponding Lower Bound

Dan Navon, Alex Bronstein|arXiv (Cornell University)|2022. 08. 17.
Machine Learning and Data Classification인용 수 5
한 줄 요약

이 논문은 랜덤 하이퍼파rameter 검색에서 추가 반복을 통해 기대 정확도 향상도를 통계적으로 엄밀하게 추정하는 방법을 제안한다. Dvoretzky–Kiefer–Wolfowitz (DKW) 부등식을 활용하여 추정 오차를 $ O\left(\sqrt{\frac{\log k}{k}}\right) $ 수준으로 제한하며, 높은 확률로 성립한다. 또한, 랜덤 검색 하이퍼파rameter 튜닝에 대해 처음으로 이러한 유형의 하한을 제공하는 이론적 하한 $ \Omega\left(\frac{\alpha^2 f_X(\alpha)}{k}\right) $ 을 설정한다.

ABSTRACT

Hyperparameter tuning is a common technique for improving the performance of neural networks. Most techniques for hyperparameter search involve an iterated process where the model is retrained at every iteration. However, the expected accuracy improvement from every additional search iteration, is still unknown. Calculating the expected improvement can help create stopping rules for hyperparameter tuning and allow for a wiser allocation of a project's computational budget. In this paper, we establish an empirical estimate for the expected accuracy improvement from an additional iteration of hyperparameter search. Our results hold for any hyperparameter tuning method which is based on random search \cite{bergstra2012random} and samples hyperparameters from a fixed distribution. We bound our estimate with an error of $O\left(\sqrt{\frac{\log k}{k}} ight)$ w.h.p. where $k$ is the current number of iterations. To the best of our knowledge this is the first bound on the expected gain from an additional iteration of hyperparameter search. Finally, we demonstrate that the optimal estimate for the expected accuracy will still have an error of $\frac{1}{k}$.

연구 동기 및 목표

  • 랜덤 검색에서 하이퍼파rameter 검색 반복을 추가로 수행했을 때 기대 정확도 향상도를 추정하기 위해.
  • 고정된 하이퍼파rameter 분포를 가진 랜덤 검색에서 기대 향상도 추정기의 높은 확률 오차 범위를 제공하기 위해.
  • 모든 추정기 중에서 가능한 최고의 추정 오차에 대한 이론적 하한을 설정하기 위해.
  • 기대 수익 감소 현상을 정량화하여 데이터 기반의 정지 기준을 가능하게 하기 위해.
  • 신경망 하이퍼파rameter 튜닝에서 표준화된 계산 예산 할당의 부재를 해결하기 위해.

제안 방법

  • 모델 정확도의 경험적 누적분포함수 $ \widehat{F}_X $ 를 $ k $ 회의 랜덤 하이퍼파aram터 시험으로부터 비모수적 추정하기 위해 Dvoretzky–Kiefer–Wolfowitz (DKW) 부등식을 사용한다.
  • 직접 밀도 추정을 피하기 위해 경험적 CDF의 역함수를 통해 기대 향상도를 추정한다.
  • 기대 향상도 추정기의 오차 범위를 $ O\left(\sqrt{\frac{\log k}{k}}\right) $ 로 유도하며, 이는 높은 확률로 성립한다.
  • 기대 향상도 $ I(\widehat{\mu}, \widehat{\sigma}, \alpha) $ 와 참값 $ I(\mu, \sigma, \alpha) $ 사이의 기대 이탈을 제한함으로써 최적 추정기의 추정 오차를 분석한다. 여기서 $ I $ 는 평균과 표준편차의 볼록 함수이다.
  • 집중 부등식과 카이제곱 분포의 성질을 적용하여, 어떤 추정기의 평균 절대 오차에 대한 하한을 유도한다.
  • 정규성 가정 하에 가장 좋은 추정기의 오차는 $ \Omega\left(\frac{\alpha^2 f_X(\alpha)}{k}\right) $ 보다 나아질 수 없다는 것을 보여준다.

실험 결과

연구 질문

  • RQ1추가로 한 번의 랜덤 하이퍼파aram터 검색 반복을 수행했을 때 모델 정확도의 기대 향상도는 얼마인가?
  • RQ2이 기대 향상도는 이전에 $ k $ 번의 평가만으로 오차가 제한된 방식으로 어떻게 추정할 수 있는가?
  • RQ3랜덤 검색에서 기대 향상도 추정기의 평균 절대 오차에 대해 가장 날카로운 하한은 무엇인가?
  • RQ4추정 오차는 반복 횟수 $ k $ 의 함수로 높은 확률로 정량화될 수 있는가?
  • RQ5추정 오차는 $ k $ 와 어떻게 스케일링되며, 이러한 추정기의 기본 정확도 한계는 무엇인가?

주요 결과

  • 추가적인 랜덤 검색 반복에서 기대 향상도는 높은 확률로 오차 $ O\left(\sqrt{\frac{\log k}{k}}\right) $ 수준으로 추정할 수 있다.
  • 기대 향상도에 대한 최고의 추정기의 평균 절대 오차는 $ \frac{\sigma^2}{2\sqrt{2\pi}k} \cdot \left[1 - F_X(\alpha)\right] $ 로부터 하한이 있다.
  • $ \alpha \geq \mu + \sqrt{\frac{3}{2}}\sigma $ 인 경우, 하한은 $ \Omega\left(\frac{\alpha^2 f_X(\alpha)}{k}\right) $ 로 향상된다.
  • 추정 오차는 $ \frac{1}{k} $ 보다 나아질 수 없으며, 이러한 추정기의 정밀도에 대한 기본 한계를 확립한다.
  • 제안된 추정기는 비모수적이며, 기저의 정확도 분포 $ f_X $ 에 대한 가정이 필요하지 않다.
  • 결과는 제한된 계산 예산에서 하이퍼파aram터 튜닝의 적응형 정지 기준에 대한 이론적 기반을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.