Skip to main content
QUICK REVIEW

[논문 리뷰] VeLO: Training Versatile Learned Optimizers by Scaling Up

Luke Metz, J. Harrison|arXiv (Cornell University)|2022. 11. 17.
Human Pose and Action Recognition인용 수 15
한 줄 요약

VeLO는 다양한 작업에서 4,000개 이상의 TPU-월에 걸친 대규모 메타학습을 통해 훈련된 유연하고 초파ram터가 없는 학습된 최적화 방법이다. VeLO는 14%의 작업에서 학습률 조정이 끝난 Adam보다 최대 16배 빠르게 성능을 냈으며, 시각, 언어, 결정 트랜스포머를 포함한 실제 모델로도 효과적으로 일반화됨을 보여주어 대규모 스케일에서 학습된 최적화의 실현 가능성을 입증한다.

ABSTRACT

While deep learning models have replaced hand-designed features across many domains, these models are still trained with hand-designed optimizers. In this work, we leverage the same scaling approach behind the success of deep learning to learn versatile optimizers. We train an optimizer for deep learning which is itself a small neural network that ingests gradients and outputs parameter updates. Meta-trained with approximately four thousand TPU-months of compute on a wide variety of optimization tasks, our optimizer not only exhibits compelling performance, but optimizes in interesting and unexpected ways. It requires no hyperparameter tuning, instead automatically adapting to the specifics of the problem being optimized. We open source our learned optimizer, meta-training code, the associated train and test data, and an extensive optimizer benchmark suite with baselines at velo-code.github.io.

연구 동기 및 목표

  • 수동적인 초파라미터 튜닝이 필요 없는 일반적인, 다용도의 학습된 최적화 방법을 개발하는 것.
  • 이전 연구를 훨씬 뛰어넘는 대규모 컴퓨팅 자원과 다양한 작업 분포를 활용해 학습된 최적화 방법의 메타학습을 확장하는 것.
  • 비슷한 작업과 실제 모델(시각, 언어, 그래프 네트워크 포함)에 대한 일반화 성능을 평가하는 것.
  • 내부 분석과 벤치마킹을 통해 학습된 최적화 방법의 동작 방식과 메커니즘을 이해하는 것.
  • 딥러닝을 위한 확장 가능하고 적응적인 최적화 연구의 기반을 마련하는 것.

제안 방법

  • VeLO는 기울기 입력을 받아 매개변수 갱신을 출력하는 신경망이며, 다양한 최적화 작업 분포를 통해 메타학습 방식으로 훈련된다.
  • 이 최적화 방법은 시각, 자연어 처리, 강화 학습 모델을 포함한 다양한 딥러닝 작업에서 약 4,000개의 TPU-월에 걸쳐 컴퓨팅 자원을 활용해 메타학습된다.
  • 메타학습은 커리큘럼 기반 접근 방식을 사용하며, 비동기식으로 배치된 기울기 갱신을 적용하고, 장기적인 수평 작업에서 기울기 노후화 문제를 완화하기 위해 큰 외부 기울기 배치를 사용한다.
  • 학습된 최적화 방법의 아키텍처는 단계당 계산 오버헤드를 최소화하도록 설계되어 있어 효율적인 추론과 더 큰 모델로의 확장성을 보장한다.
  • 평가 작업은 VeLOdrome라는 83개의 표준 작업으로 구성된 벤치마크 세트와 여러 도메인의 실제 모델 훈련을 통해 수행된다.
  • 시스템은 velo-code.github.io에서 전체 메타학습 코드, 데이터, 그리고 포괄적인 벤치마크 세트를 함께 공개한다.

실험 결과

연구 질문

  • RQ1초파라미터 튜닝 없이도 학습된 최적화 방법이 다양한 딥러닝 작업에 일반화될 수 있는가?
  • RQ2메타학습 컴퓨팅 자원과 작업 다양성의 확장을 통해 학습된 최적화 방법의 성능와 내구성에 어떤 영향을 미치는가?
  • RQ3대규모 학습된 최적화 방법이 다양한 훈련 동역학에 적응적으로 최적화하기 위해 어떤 메커니즘을 개발하는가?
  • RQ4다양한 벤치마크에서 수동으로 설계하고 튜닝한 최적화 방법(예: Adam, NAdamW)과 비교해 초파라미터가 없는 최적화 방법은 어떤가?
  • RQ5학습 분포를 초월해 외삽할 때 학습된 최적화 방법의 실패 모드와 안정성 문제는 무엇인가?

주요 결과

  • VeLOdrome 벤치마크의 83개 작업 중 50%에서 학습률 조정이 끝난 Adam보다 4배 이상의 속도 향상을 달성했다.
  • 14% 이상의 작업에서 VeLO는 학습률 조정이 끝난 Adam보다 16배 이상 더 빠르게 성능을 냈으며, 강력한 일반화 능력과 적응성의 가능성을 입증했다.
  • RNN-MLP 및 STAR 최적화 방법을 포함한 이전의 학습된 최적화 방법보다 성능과 효율성 면에서 뛰어났다.
  • 특정 작업에 맞추어 튜닝하지 않아도 ResNets, NERF, 검출 모델, 트랜스포머, 그래프 네트워크를 포함한 실제 모델로도 잘 일반화되었다.
  • 초파라미터 조정 없이도 다양한 아키텍처와 데이터셋에서 경쟁 가능한 성능을 달성했다.
  • 강력한 성능에도 불구하고 VeLO는 일부 분포 외부 작업에서 갑작스럽게 발산하는 경우가 있어, 향후 안정성 메커니즘 개선이 필요함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.