Skip to main content
QUICK REVIEW

[논문 리뷰] Accelerating Deep Learning Inference via Freezing

Adarsh Kumar, Arjun Balasubramanian|arXiv (Cornell University)|2020. 02. 07.
Advanced Neural Network Applications인용 수 4
한 줄 요약

이 논문은 k-means 클러스터링을 사용해 중간 활성화를 캐시함으로써 딥 러닝 추론을 가속화하는 Freeze Inference 시스템을 제안한다. 이는 근사적이고 저지연 추론을 가능하게 하며, ResNet-18에서 CIFAR-10 요청의 91.58%에 대해 최대 50%의 효과적 계산을 감소시킨다. 캐시 메모리 12.5MB만으로도 92.85%의 정확도를 달성한다.

ABSTRACT

Over the last few years, Deep Neural Networks (DNNs) have become ubiquitous owing to their high accuracy on real-world tasks. However, this increase in accuracy comes at the cost of computationally expensive models leading to higher prediction latencies. Prior efforts to reduce this latency such as quantization, model distillation, and any-time prediction models typically trade-off accuracy for performance. In this work, we observe that caching intermediate layer outputs can help us avoid running all the layers of a DNN for a sizeable fraction of inference requests. We find that this can potentially reduce the number of effective layers by half for 91.58% of CIFAR-10 requests run on ResNet-18. We present Freeze Inference, a system that introduces approximate caching at each intermediate layer and we discuss techniques to reduce the cache size and improve the cache hit rate. Finally, we discuss some of the open research challenges in realizing such a design.

연구 동기 및 목표

  • 점점 더 복잡하고 정확도가 높아지는 모델로 인해 증가하는 딥 뉴럴 네트워크(DNN)의 추론 지연을 해결한다.
  • 양자화나 정규화와 같은 이전 방법들과 달리, 모델 정확도를 훼손하지 않고 예측 지연을 감소시킨다.
  • 다수의 추론 요청에서 전체 전방 전파를 피하기 위해 중간 레이어 출력을 캐싱할 수 있는지 탐색한다.
  • 빠른 검색과 높은 정확도를 유지하면서도 메모리 사용을 최소화하는 스케일링 가능하고 저메모리 캐싱 시스템을 설계한다.
  • 동적 배치 처리와 점진적 업데이트를 지원하는 실세계 DNN 서빙 시스템에 캐싱을 실용적으로 구현할 수 있도록 한다.

제안 방법

  • 학습 데이터에서 중간 레이어 출력의 오프라인 캐시를 구축하고, 고차원 텐서를 압축하기 위해 차원 축소 기법을 적용한다.
  • 압축된 차원 공간에서 k-means 클러스터링을 적용하여 메모리 사용량을 최소화하기 위해 클러스터 중심점만 저장한다.
  • 새로운 입력을 가장 가까운 클러스터 중심점과 매칭하기 위해 k-최근접 이웃(k-NN) 검색을 사용하여 빠른 캐시 검색을 구현한다.
  • 캐시된 중심점에서의 예측이 충분히 신뢰할 수 있는지 판단하기 위해 신뢰도 임계값을 도입한다.
  • 거리 계산을 CPU로 이관하여 캐시 검색 성능을 최적화함으로써 단일 DNN 레이어 계산보다 약 20배 빠른 성능을 달성한다.
  • 시간이 지남에 따라 새로운 자주 발생하는 입력에 적응하기 위해 동적 배치 처리와 점진적 캐시 업데이트를 지원하는 시스템을 설계한다.

실험 결과

연구 질문

  • RQ1DNN의 중간 레이어 출력을 효과적으로 캐시하여 다수의 추론 요청에서 전체 전방 전파를 피할 수 있는가?
  • RQ2근사 캐싱을 어떻게 설계할 수 있을까? 이는 메모리 사용, 검색 속도, 예측 정확도 간의 균형을 유지해야 한다.
  • RQ3레이어별 클러스터링과 임계값 설정이 지연 감소와 정확도 간의 트레이드오프에 미치는 영향은 무엇인가?
  • RQ4동적 배치 처리를 지원하는 GPU 기반 추론 파이프라인에 캐싱을 어떻게 통합할 수 있는가?
  • RQ5모델 전체를 재학습하지 않고도 점진적이고 온라인으로 캐시를 업데이트할 수 있는 메커니즘은 무엇인가?

주요 결과

  • Freeze Inference는 중간 레이어 캐싱을 통해 ResNet-18에서 CIFAR-10 요청의 91.58%에 대해 최대 50%의 효과적 레이어 수를 감소시킨다.
  • 캐시된 중심점 기반 예측을 사용할 경우 CIFAR-10에서 92.85%의 정확도, CIFAR-100에서는 88.86%의 정확도를 달성한다.
  • 캐시 검색 속도는 단일 DNN 레이어 계산보다 약 20배 빠르며, 저지연 추론을 가능하게 한다.
  • ResNet-18에 대해 최종 캐시는 단지 12.5MB의 메모리만 필요하며, k-means 클러스터링을 통한 높은 메모리 효율성을 입증한다.
  • 냉각 요청 비율과 정확도 간의 트레이드오프는 임계값 파rameter를 조절하여 조정 가능하며, 높은 임계값은 정확도를 향상시키지만 냉각 가능한 요청 수를 줄인다.
  • 이 방법은 비균일한 요청 워크로드 환경에서 실세계 적용 잠재력을 보이며, 동적 배치 처리와 온라인 업데이트 문제는 아직 해결되지 않은 과제로 남아 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.