Skip to main content
QUICK REVIEW

[논문 리뷰] Tune As You Scale: Hyperparameter Optimization For Compute Efficient Training

Abraham J. Fetterman, Ellie Kitanidis|arXiv (Cornell University)|2023. 06. 13.
Machine Learning and Data Classification인용 수 4
한 줄 요약

CARBS는 성능-비용 파레토 경계 주변에서 국소적 탐색을 수행함으로써 대규모 딥러닝 모델의 효율적이고 자동화된 초파rameter 튜닝을 가능하게 하는 비용 인지 베이지안 최적화 알고리즘입니다. 모든 초파rameter에 대한 스케일링 법칙을 발견하고, 더 적은 계산 자원으로 Chinchilla의 모델 스케일링 결과를 재현하며, PPO 튜닝만으로도 전체 ProcGen 벤치마크를 해결함으로써 기존 기준 대비 뛰어난 샘플 효율성과 강건성을 입증합니다.

ABSTRACT

Hyperparameter tuning of deep learning models can lead to order-of-magnitude performance gains for the same amount of compute. Despite this, systematic tuning is uncommon, particularly for large models, which are expensive to evaluate and tend to have many hyperparameters, necessitating difficult judgment calls about tradeoffs, budgets, and search bounds. To address these issues and propose a practical method for robustly tuning large models, we present Cost-Aware Pareto Region Bayesian Search (CARBS), a Bayesian optimization algorithm that performs local search around the performance-cost Pareto frontier. CARBS does well even in unbounded search spaces with many hyperparameters, learns scaling relationships so that it can tune models even as they are scaled up, and automates much of the "black magic" of tuning. Among our results, we effectively solve the entire ProcGen benchmark just by tuning a simple baseline (PPO, as provided in the original ProcGen paper). We also reproduce the model size vs. training tokens scaling result from the Chinchilla project (Hoffmann et al. 2022), while simultaneously discovering scaling laws for every other hyperparameter, via an easy automated process that uses significantly less compute and is applicable to any deep learning problem (not just language models).

연구 동기 및 목표

  • 대규모 딥러닝 모델의 초파라미터 튜닝에서 평가가 비용이 많이 들고 스케일링 관계가 비트레이스러운 경우의 비효율성과 수동 작업 문제를 해결하기 위해.
  • 검색 범위나 학습 예산을 수동으로 지정하는 것을 제거함으로써 튜닝 과정을 자동화하고, 초파라미터 선택의 편향성과 재현 불가능성을 줄이기 위해.
  • 모든 초파라미터에 대한 비용 의존성 스케일링 법칙을 학습함으로써 고차원 공간에서 강건하고 확장 가능한 초파라미터 최적화를 가능하게 하기 위해.
  • Chinchilla 프로젝트에서 관찰된 복잡한 스케일링 행동을 자동으로 재현하고, 기존 방법보다 훨씬 적은 계산 자원으로 이를 달성하기 위해.
  • PPO와 같은 단순 기준 모델이 CARBS로 튜닝될 경우, 강화학습, 언어 모델링, 이미지 분류를 포함한 다양한 과제에서 최신 기준 성능을 달성할 수 있음을 보여주기 위해.

제안 방법

  • CARBS는 초파라미터의 함수로서 모델 성능과 학습 비용(시간 기준)을 함께 모델링하기 위해 가우시안 프로세스(GP) 서로서 모델을 사용합니다.
  • 현재 성능-비용 파레토 경계 주변에서 국소적 베이지안 최적화를 수행함으로써 고차원 공간에서의 샘플 효율성을 향상시킵니다.
  • 획득 함수는 파레토 경계를 기준으로 한 기대 개선도(EI-PF)를 사용하며, 비용 인지성을 통합하여 효율적이고 높은 성능을 보이는 구성 요소를 우선순위로 지정합니다.
  • 학습률, 배치 크기, 학습 토큰 수와 같은 초파라미터에 대해 동적으로 스케일링 법칙을 학습함으로써 더 큰 모델로의 외삽을 가능하게 합니다.
  • 저비용 영역과 고성능 영역의 탐색 균형을 맞추기 위해 무작위 비용 클램핑 메커니즘을 포함하고, 관측치의 노이즈를 줄이기 위해 재표본 추출을 수행합니다.
  • 각 초파라미터에 대해 초기 검색 중심점만 필요로 하여 사전 정의된 검색 범위나 예산 제약 조건이 필요 없도록 합니다.

실험 결과

연구 질문

  • RQ1초파라미터 수가 많고 평가 비용이 높은 경우, 특히 스케일업할 때에도 효율적으로 딥러닝 모델을 튜닝할 수 있는 베이지안 최적화 알고리즘이 존재하는가?
  • RQ2수동 간섭 없이도 학습 토큰 수나 에포크 수를 포함한 모든 초파라미터에 대한 스케일링 법칙을 자동으로 발견할 수 있는가?
  • RQ3비용 인지성과 파레토 중심의 국소 탐색 전략이 샘플 효율성과 강건성 측면에서 글로벌 또는 비비용 인지 전략보다 뛰어나게 성능을 냅니까?
  • RQ4PPO와 같은 단순 기준 모델이 CARBS로 튜닝될 경우, ProcGen과 같은 도전적인 벤치마크에서 최신 기준 성능을 달성할 수 있습니까?
  • RQ5CARBS는 기존 방법보다 훨씬 적은 계산 자원으로 Chinchilla 프로젝트에서 관찰된 복잡한 스케일링 법칙을 재현할 수 있습니까?

주요 결과

  • 언어 모델링 과제에서 CARBS는 ASHA 및 BOHB와 같은 다른 튜닝 알고리즘보다 최고의 중앙값 성능과 가장 낮은 분산을 기록했습니다.
  • MuJoCo Ant-v4 강화학습 과제에서 CARBS는 다른 알고리즘보다 파레토 경계 근처에서 더 많은 관측치를 생성했으며, 이는 샘플 효율성과 서로서 모델 품질 측면에서 뛰어난 성능을 의미합니다.
  • CARBS는 오직 PPO 기준 모델만 튜닝함으로써 전체 ProcGen 벤치마크를 해결했으며, 이는 체계적인 초파라미터 튜닝이 단순한 모델로부터 돌파구를 이끌어낼 수 있음을 보여줍니다.
  • CARBS는 Chinchilla 프로젝트에서 관찰된 모델 크기 대 학습 토큰 수 스케일링 법칙(Hoffmann 등, 2022)을 재현하였고, 동시에 모든 다른 초파라미터에 대한 스케일링 법칙도 한 번의 자동 튜닝 런 내에서 발견했습니다.
  • 제거 실험 결과, 파레토 기반 획득 함수, 비용 클램핑, 재표본 추출 등의 핵심 구성 요소를 제거할 경우 성능이 크게 악화됨을 확인하였으며, 각 설계 선택의 필수성을 입증했습니다.
  • CARBS는 검색 범위나 예산 사양이 필요 없었으며, 이는 완전히 자동화된 알고리즘이며, 실질적으로 고정되는 경향이 있는 학습 기간과 같은 초파라미터를 포함한 모든 딥러닝 문제에 적용 가능함을 의미합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.