Skip to main content
QUICK REVIEW

[논문 리뷰] Faster Neural Network Training with Approximate Tensor Operations

Menachem Adelman, Kfir Y. Levy|arXiv (Cornell University)|2018. 05. 21.
Advanced Neural Network Applications참고 문헌 57인용 수 9
한 줄 요약

이 논문은 행렬 곱셈과 컨볼루션과 같은 텐서 연산에 표본 기반 근사 기법을 적용하여 딥 네ural 네트워크 학습을 가속화하는 새로운 방법을 제안한다. Top-k-CRS와 Bernoulli-CRS와 같은 효율적인 표본 추출 기법을 사용함으로써 계산량과 통신량을 최대 66% 감소시키며, MNIST, CIFAR-10, ImageNet 벤치마크에서 정확도 손실가장 최소화하면서 최대 1.37배 빠른 학습을 달성한다.

ABSTRACT

We propose a novel technique for faster deep neural network training which systematically applies sample-based approximation to the constituent tensor operations, i.e., matrix multiplications and convolutions. We introduce new sampling techniques, study their theoretical properties, and prove that they provide the same convergence guarantees when applied to SGD training. We apply approximate tensor operations to single and multi-node training of MLP and CNN networks on MNIST, CIFAR-10 and ImageNet datasets. We demonstrate up to 66% reduction in the amount of computations and communication, and up to 1.37x faster training time while maintaining negligible or no impact on the final test accuracy.

연구 동기 및 목표

  • 모델 정확도를 희생시키지 않고 더 빠른 딥 네ural 네트워크 학습이 필요하다는 문제를 해결한다.
  • 단일 및 다중 노드 학습 환경에서 텐서 연산에 표본 기반 근사 기법을 체계적으로 적용한다.
  • 분산 환경에서 학습 시간과 통신 대역폭 향상을 위한 실용적인 성능 향상을 달성한다.
  • 근사 연산을 사용할 경우 확률적 경사 하강법(SGD)의 이론적 수렴 보장을 확보한다.
  • 기존 딥 러닝 프레임워크와 표준 통신 프리미티브(예: AllReduce)와 호환되는 표본 추출 기법을 개발한다.

제안 방법

  • 전방 및 역방향 전파에서 행렬 곱셈을 근사하기 위해 열-행 표본 추출(CRS) 및 그 변종인 Bernoulli-CRS와 Top-k-CRS를 적용한다.
  • Top-k-CRS를 사용해 최대 노름을 가진 열-행 쌍을 결정적으로 선택함으로써, 쌍별 독립 조건 하에서 평균 제곱오차를 최소화한다.
  • 근사 오차 분석 기반 최적의 표본 추출 정책을 유도하여 다중 채널 컨볼루션으로 표본 추출 기법을 일반화한다.
  • 네트워크 아키텍처와 텐서 차원을 유지하면서 PyTorch에 근사 기법을 최소한의 코드 변경으로 통합한다.
  • 데이터 병렬 분산 학습에서 스파arsity를 활용해 통신 대역폭을 줄이는 그래디언트 통신 기법을 설계한다.
  • 오직 표본화된 그래디언트 성분만 전송함으로써 표준 AllReduce와의 호환성을 유지한다.

실험 결과

연구 질문

  • RQ1정확도가 크게 떨어지지 않는 범위에서 근사 텐서 연산을 사용해 딥 네ural 네트워크를 효과적으로 학습시킬 수 있는가?
  • RQ2근사된 행렬 곱셈과 컨볼루션에 적용된 SGD의 이론적 수렴 성질은 어떠한가?
  • RQ3다양한 표본 추출 전략(예: Bernoulli-CRS 대비 Top-k-CRS)이 학습 안정성과 최종 모델 정확도에 어떤 영향을 미치는가?
  • RQ4분산 학습에서 근사화가 계산량과 통신량을 얼마나 줄일 수 있으며, 수렴 성질은 유지되는가?
  • RQ5제안된 방법이 기존 딥 러닝 프레임워크와 학습 파이프라인에 원활하게 통합될 수 있는가?

주요 결과

  • Top-k-CRS 알고리즘은 평가된 모든 데이터셋에서 가장 높은 테스트 정확도를 달성하며, Bernoulli-CRS 및 기타 표본 추출 전략을 능가한다.
  • WRN-28-10를 사용한 CIFAR-10에서 전방 전파 시 90% 표본 추출이 기준 모델 대비 정확도를 1% 이내로 유지하면서 학습 속도를 1.33배 빠르게 한다.
  • ImageNet에서 ResNet-50을 사용할 경우, 1024개 이상의 채널을 가진 레이어(총 FLOPs의 93%)에서 50% 표본 추출을 적용해 정확히 동일한 top-1 정확도를 확보한다.
  • ResNet-152에서 1024개 이상의 채널을 가진 레이어(총 FLOPs의 91%)에서 50% 표본 추출을 적용해 기준 모델 대비 top-1 정확도를 0.5% 이내로 유지한다.
  • 다중 노드 분산 학습 환경에서, 표본화된 그래디언트를 사용한 AllReduce를 적용해 통신 대역폭을 감소시키며 최대 1.37배의 속도 향상을 달성한다.
  • 이론적 분석을 통해 제안된 근사 기법이 유한한 가중치와 유한한 활성화 함수 조건 하에서 SGD의 수렴 보장을 유지함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.