Skip to main content
QUICK REVIEW

[논문 리뷰] Layer Freezing & Data Sieving: Missing Pieces of a Generic Framework for Sparse Training

Geng Yuan, Yanyu Li|arXiv (Cornell University)|2022. 09. 22.
Machine Learning and ELM인용 수 4
한 줄 요약

이 논문은 정밀도를 훼손하지 않고 학습 비용을 줄이기 위해 계층 동결과 데이터 체질 기법을 통합한 일반적인 프레임워크인 SpFDE를 제안한다. 점진적으로 초기 계층을 동결하고 동적으로 학습 데이터셋을 축소함으로써 SpFDE는 FLOPs와 메모리 사용량을 크게 감소시키면서도 다양한 희박성 수준에서 ImageNet과 CIFAR-100에서 최신 기술보다 뛰어난 성능을 달성한다.

ABSTRACT

Recently, sparse training has emerged as a promising paradigm for efficient deep learning on edge devices. The current research mainly devotes efforts to reducing training costs by further increasing model sparsity. However, increasing sparsity is not always ideal since it will inevitably introduce severe accuracy degradation at an extremely high sparsity level. This paper intends to explore other possible directions to effectively and efficiently reduce sparse training costs while preserving accuracy. To this end, we investigate two techniques, namely, layer freezing and data sieving. First, the layer freezing approach has shown its success in dense model training and fine-tuning, yet it has never been adopted in the sparse training domain. Nevertheless, the unique characteristics of sparse training may hinder the incorporation of layer freezing techniques. Therefore, we analyze the feasibility and potentiality of using the layer freezing technique in sparse training and find it has the potential to save considerable training costs. Second, we propose a data sieving method for dataset-efficient training, which further reduces training costs by ensuring only a partial dataset is used throughout the entire training process. We show that both techniques can be well incorporated into the sparse training algorithm to form a generic framework, which we dub SpFDE. Our extensive experiments demonstrate that SpFDE can significantly reduce training costs while preserving accuracy from three dimensions: weight sparsity, layer freezing, and dataset sieving.

연구 동기 및 목표

  • 희박성 증가 외의 다른 비용 절감 전략을 탐색하여, 일반적으로 정밀도 저하를 초래하는 희박성 증가 문제를 해결하고자 한다.
  • 이전에 이 분야에서 탐색되지 않은 정밀 학습에서의 계층 동결 기법의 타당성과 효율성을 조사하고자 한다.
  • 정보성 높은 샘플을 동적으로 선택함으로써 종단 간 데이터셋 효율적 학습을 가능하게 하는 데이터 체질 기법을 개발하고자 한다.
  • 정밀 학습을 위한 일반적이고 즉시 사용 가능한 프레임워크인 SpFDE를 개발하여, 가중치 희박성, 계층 동결, 데이터 체질을 통합한 통합 학습 파이프라인을 구현하고자 한다.
  • 가중치 희박성, 계층 동결, 데이터셋 축소를 조합함으로써 더 뛰어난 학습 효율성과 메모리 절감 효과를 얻을 수 있음을 입증하고자 한다.

제안 방법

  • 학습 중 구조적 및 표현 유사도를 기반으로 초기 계층을 식별하고 동결하는 점진적 계층 동결 전략을 제안한다.
  • 학습 전반에 걸쳐 데이터셋에서 가장 정보성 높은 샘플만을 지속적으로 필터링하고 유지하는 동적 데이터 체질 기법을 도입한다.
  • 가중치 희박성, 계층 동결, 데이터 체질을 통합한 통합 학습 파이프라인을 제공하는 일반적 프레임워크인 SpFDE를 설계한다.
  • 희박성, 동결된 계층, 축소된 데이터셋 크기를 고려하여 비용 절감을 평가하기 위해 학습 FLOPs 기반 지표를 사용한다.
  • 메모리 비용을 측정하기 위해 배치 크기 64로 32비트 부동소수점 표현을 사용하며, SpFDE를 기준선 DST 방법과 비교한다.
  • 계층 동결과 데이터 체질의 기여도를 분리하기 위해 분석 실험을 실시하여 각각의 영향과 병합 효과를 검증한다.

실험 결과

연구 질문

  • RQ1동적 희박 학습(DST)의 동적 희박성 패턴에도 불구하고 계층 동결이 정밀 학습에 효과적으로 적용될 수 있는가?
  • RQ2특히 정적 데이터셋 축소와 비교했을 때, 데이터 체질은 정밀 학습에서 모델 정확도와 학습 효율성에 어떤 영향을 미치는가?
  • RQ3가중치 희박성, 계층 동결, 데이터셋 축소의 병합 효과는 학습 FLOPs와 메모리 비용에 어떤 영향을 미치는가?
  • RQ4다양한 희박성 수준에서 SpFDE는 최신 정밀 학습 기법들과 정확도와 효율성 측면에서 어떻게 비교되는가?
  • RQ5이 세 가지 기법을 조합했을 때 정확도, FLOPs, 메모리 사용량, 실제 학습 가속도 사이의 최적의 트레이드오프는 무엇인가?

주요 결과

  • SpFDE는 ResNet-50 기반 ImageNet에서 동일한 FLOPs 수준에서 MEST 및 기타 SOTA 기법보다 높은 상위-1 정확도를 달성하였으며, 0.95×10^18 FLOPs에서 최고의 결과로 76.03%를 기록하였다.
  • 95% 희박성에서 SpFDE는 기준선 DST 방법 대비 최대 43.9%의 학습 FLOPs 절감을 이룩하였으며, 최소 메모리 비용도 기존 방법보다 현저히 낮았다.
  • SpFDE의 평균 메모리 비용은 기준선 DST 방법이 요구하는 최소값 대비 20~25.3% 낮았으며, 주기적인 밀도 역전파와 같은 추가 오버헤드를 고려한 상황에서도 마찬가지였다.
  • SpFDE의 데이터 체질 기법은 학습 세트를 동적으로 업데이트하여 과적합을 완화시키며, MEST에서 사용하는 한 번의 데이터셋 축소보다 높은 정확도를 달성하였다.
  • 분석 실험 결과, 계층 동결과 데이터 체질이 각각 성능 향상에 기여하며, 두 기법의 조합이 가장 강력한 성능 향상을 이끌었다.
  • SpFDE는 이전 SOTA인 RigL-ITOP를 능가하며, 0.95×10^18 FLOPs에서 76.03%의 상위-1 정확도를 기록했고, 기준선 방법 대비 메모리 사용량과 FLOPs를 모두 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.