[논문 리뷰] A Generalizable Approach to Learning Optimizers
이 논문은 LSTMs 컨트롤러, 단위 없는 특징, 상대적 행동, 그리고 새로운 보상 함수를 사용하여 최적화기 하이퍼파rameter(예: 학습률)를 학습하는 일반화 가능한 접근법인 학습된 하이퍼파rameter 최적화기(LHOPTs)를 제안한다. 이 방법은 ImageNet에서 2배, 대규모 언어 모델링에서 2.5배의 속도 향상을 달성하며, 계산량에 5개 이상의 지수 차이가 나는 다양한 작업 간에 일반화되며, 튜닝된 Adam과 기본 최적화기보다 뛰어난 성능을 보인다.
A core issue with learning to optimize neural networks has been the lack of generalization to real world problems. To address this, we describe a system designed from a generalization-first perspective, learning to update optimizer hyperparameters instead of model parameters directly using novel features, actions, and a reward function. This system outperforms Adam at all neural network tasks including on modalities not seen during training. We achieve 2x speedups on ImageNet, and a 2.5x speedup on a language modeling task using over 5 orders of magnitude more compute than the training tasks.
연구 동기 및 목표
- 기존의 학습된 최적화기가 훈련 분포 외부의 실제 작업에서 일반화에 실패하는 데 기인한 문제를 해결하기 위해.
- 모델 파라미터 업데이트가 아닌 하이퍼파rameter 업데이트를 학습함으로써, 과제에 특화된 성능이 아닌 일반화를 우선시하는 프레임워크를 개발하기 위해.
- 정책 업데이트 빈도를 내부 최적화 단계 수와 분리함으로써 보다 넓은 적용 가능성을 확보하기 위해.
- 다양한 신경망 아키텍처와 모odalities 간의 강건성과 이식 가능성을 향상시키기 위해 특징, 행동, 보상 함수를 설계하기 위해.
- 학습된 최적화기가 계산량과 모델 규모에 수개의 지수 차이가 나는 실제 문제에 일반화될 수 있음을 입증하기 위해.
제안 방법
- 시스템은 사용자가 정의한 빈도로 LSTM 컨트롤러를 사용하여 최적화기 하이퍼파rameter를 업데이트하며, 이는 내부 최적화 단계와 독립적이다.
- 훈련 통계(예: 기울기 노름, 손실 추세 등)에서 유도된 단위 없는 정규화된 특징을 사용하여 다양한 과제에서의 강건성을 향상시킨다.
- 행동는 하이퍼파rameter에 대한 상대적 변화(예: 곱셈 스케일링)로 정의되어 절대값에 대한 불변성을 확보한다.
- 최종 모델 성능을 최적화하기 위해 설계된 새로운 보상 함수를 사용하여 일반화를 촉진한다.
- 다양한 소규모 과제(예: MNIST, CIFAR-10, 소규모 언어 모델링 과제)에서 강화학습을 통해 정책을 훈련한다.
- 소규모 과제에서 학습된 하이퍼파라미터 스케줄은 재학습 없이 대규모 모델로 이식되어 제로샷 일반화를 가능하게 한다.
실험 결과
연구 질문
- RQ1학습 분포와 현저히 다를 뿐만 아니라 더 큰 과제에 대해 학습된 최적화기가 일반화될 수 있는가?
- RQ2파라미터 업데이트가 아닌 하이퍼파라미터 업데이트를 학습하는 것이 일반화와 계산 효율성에 도움이 되는가?
- RQ3제안된 보상 함수가 다양한 신경망 아키텍처와 모달리티 간의 이식 가능성을 얼마나 효과적으로 향상시키는가?
- RQ4단위 없는 특징과 상대적 행동이 분포 이동에 대해 얼마나 강건성을 향상시키는가?
- RQ5소규모 과제에서 학습된 단일 하이퍼파라미터 스케줄이 대규모로 잘 튜닝된 모델에서 상당한 속도 향상을 이끌 수 있는가?
주요 결과
- LHOPTs는 튜닝된 AdamW보다 ImageNet 훈련에서 2배의 속도 향상을 달성하며, 대상 과제에서 하이퍼파라미터 튜닝 없이도 성능을 내는 데 성공했다.
- 대규모 언어 모델링 과제에서 LHOPTs는 평균 170 GPU-초의 과제에서 학습된 후에도 2.5배의 속도 향상을 제공했다.
- 이 방법은 계산량에 5개 이상의 지수 차이가 나는 과제 간에 일반화되며, 소규모 과제에서부터 최대 300 GPU-일까지 필요한 모델까지 적용 가능하다.
- LHOPTs는 훈련 중에 볼 수 없었던 음성 인식 및 신경 협업 필터링 과제에서 MLPerf 기준 및 튜닝된 Adam보다 뛰어난 성능을 보였다.
- 계산 오버헤드는 매우 낮으며, 트랜스포머에서는 20% 미만, ResNets에서는 2% 미만으로, 효율적인 특징 계산과 일정 크기의 정책 네트워크 덕분이다.
- 28x28 이미지에서만 학습하고 어텐션 메커니즘에 노출되지 않은 상태에서도 일반화가 가능하다는 점은, 과거에 생각했던 것보다 과제의 다양성이 덜 중요할 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.