Skip to main content
QUICK REVIEW

[논문 리뷰] Benchmarking Neural Network Training Algorithms

George E. Dahl, Frank Schneider|arXiv (Cornell University)|2023. 06. 12.
Advanced Neural Network Applications인용 수 6
한 줄 요약

이 논문은 표준화된 조건에서 딥러닝 학습 알고리즘을 평가하기 위한 경쟁적 시간-결과 기준인 AlgoPerf: Training Algorithms를 소개한다. 학습 완료 정의, 워크로드 민감도, 하이퍼파ram터 조정과 같은 공정한 비교의 핵심 과제를 해결하기 위해 고정된 하드웨어, 다양한 워크로드 변형, 성능 프로파일링을 사용하여 최적화기 간에 유의미한 성능 격차가 있음을 입증하고 일시적인 최고 성능 기준을 설정한다.

ABSTRACT

Training algorithms, broadly construed, are an essential part of every deep learning pipeline. Training algorithm improvements that speed up training across a wide variety of workloads (e.g., better update rules, tuning protocols, learning rate schedules, or data selection schemes) could save time, save computational resources, and lead to better, more accurate, models. Unfortunately, as a community, we are currently unable to reliably identify training algorithm improvements, or even determine the state-of-the-art training algorithm. In this work, using concrete experiments, we argue that real progress in speeding up training requires new benchmarks that resolve three basic challenges faced by empirical comparisons of training algorithms: (1) how to decide when training is complete and precisely measure training time, (2) how to handle the sensitivity of measurements to exact workload details, and (3) how to fairly compare algorithms that require hyperparameter tuning. In order to address these challenges, we introduce a new, competitive, time-to-result benchmark using multiple workloads running on fixed hardware, the AlgoPerf: Training Algorithms benchmark. Our benchmark includes a set of workload variants that make it possible to detect benchmark submissions that are more robust to workload changes than current widely-used methods. Finally, we evaluate baseline submissions constructed using various optimizers that represent current practice, as well as other optimizers that have recently received attention in the literature. These baseline results collectively demonstrate the feasibility of our benchmark, show that non-trivial gaps between methods exist, and set a provisional state-of-the-art for future benchmark submissions to try and surpass.

연구 동기 및 목표

  • 딥러닝 학습 알고리즘을 비교하기 위한 신뢰할 수 있고 표준화된 벤치마크의 부족을 해결하기 위해.
  • 실험적 비교에서의 세 가지 핵심 과제를 해결하기 위해: 정확한 학습 시간 측정, 워크로드 민감도, 공정한 하이퍼파ram터 조정.
  • 재현 가능하고 경쟁적인 벤치마크를 구축하여 학습 알고리즘 향상의 공정한 평가를 가능하게 하기 위해.
  • 다양한 워크로드를 통해 기본 최적화기를 평가하여 벤치마크의 실현 가능성을 입증하기 위해.
  • 엄격하고 표준화된 평가를 통해 향후 알고리즘 제출물이 넘어설 수 있는 일시적인 최고 성능 기준을 설정하기 위해.

제안 방법

  • 재현 가능성과 공정성을 보장하기 위해 고정된 하드웨어와 다수의 다양한 워크로드를 사용하여 시간-결과 기준을 설계하기 위해.
  • 모델 아키텍처, 데이터, 학습 하이퍼파ram터를 수정하여 워크로드 변형을 정의함으로써 다양한 설정에서의 강건성 테스트를 수행하기 위해.
  • 외부 조정(기본 워크로드에서 수행)과 자기 조정(각 변형에서 수행)을 포함한 이중 조정 프로토콜을 구현하여 일반화 능력을 평가하기 위해.
  • 성능 프로파일을 사용하여 워크로드 간 결과를 집계함으로써 알고리즘 효율성의 견고한 비교를 가능하게 하기 위해.
  • 과적합을 방지하고 일반화 가능성을 확보하기 위해 평가에 포함되지 않은 워크로드를 통합하기 위해.
  • 높은 계산 비용과 불안정성으로 인해 자동화된 무작위화에 의존하지 않고, 수작업으로 워크로드 변형을 구성하는 프로토콜를 채택하기 위해.

실험 결과

연구 질문

  • RQ1다양한 딥러닝 워크로드 간에 학습 속도를 어떻게 정확하게 측정하고 정의할 수 있는가?
  • RQ2다른 모델 아키텍처나 데이터 분포에서 최적화기 순위는 어느 정도 변화하는가?
  • RQ3다른 하이퍼파ram터 조정 절차를 요구하는 학습 알고리즘 간의 공정한 비교는 어떻게 이루어질 수 있는가?
  • RQ4표준화된 벤치마크는 워크로드 변형에 대해 잘 일반화되는 학습 알고리즘을 탐지하고 보상할 수 있는가?
  • RQ5엄격하고 표준화된 조건에서 평가했을 때 현재 최고 수준의 최적화기 간에 어떤 성능 격차가 존재하는가?

주요 결과

  • AlgoPerf 벤치마크는 널리 사용되는 최적화기 간에 유의미한 성능 격차를 성공적으로 식별하여 알고리즘 개선이 측정 가능하고 영향을 미칠 수 있음을 입증한다.
  • 기본 결과에서는 AdamW와 NadamW와 같은 최적화기가 표준 SGD보다 여러 워크로드에서 유의미하게 빠른 시간-결과 성능을 보이며, 일부 경우에서 성능 격차가 20% 이상을 초과한다.
  • 성능 프로파일은 일부 최적화기가 워크로드 변형에 더 강건한 반면, 다른 최적화기는 모델이나 데이터 설정이 변경될 때 급격히 성능이 떨어지는 경향이 있음을 드러낸다.
  • 벤치마크에서 포함되지 않은 워크로드를 활용함으로써 특정 구성에 대한 과적합을 방지하여 상위 성능 제출물이 잘 일반화됨을 보장한다.
  • 자동화된 랜덤화에 비해 수작업으로 워크로드 변형을 구성하는 것이 더 효과적이고 효율적이었으며, 자동화된 방법은 높은 기각률과 불안정성 문제를 야기했다.
  • 벤치마크는 일시적인 최고 성능 기준을 설정하여 향후 알고리즘 제출물이 이를 뛰어넘을 수 있는 명확한 목표를 제시한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.