Skip to main content
QUICK REVIEW

[논문 리뷰] Tartan: Accelerating Fully-Connected and Convolutional Layers in Deep Learning Networks by Exploiting Numerical Precision Variability

Alberto Delmás, Sayeh Sharify|arXiv (Cornell University)|2017. 07. 27.
Advanced Neural Network Applications참고 문헌 22인용 수 16
한 줄 요약

Tartan (TRT)는 각 레이어별로 수치 정밀도를 동적으로 조정하고 하이브리드 비트-직렬/비트-병렬 처리 유닛을 사용하여 딥 네ural 네트워크의 완전 연결 및 컨볼루션 레이어를 가속화하는 하드웨어 가속기이다. 최신 비트-병렬 가속기 대비 최대 1.90배 빠른 추론 속도와 1.17배 높은 에너지 효율성을 달성하며, 정확도를 1% 포기함으로써 성능 향상을 추가로 얻을 수 있다.

ABSTRACT

Tartan (TRT), a hardware accelerator for inference with Deep Neural Networks (DNNs), is presented and evaluated on Convolutional Neural Networks. TRT exploits the variable per layer precision requirements of DNNs to deliver execution time that is proportional to the precision p in bits used per layer for convolutional and fully-connected layers. Prior art has demonstrated an accelerator with the same execution performance only for convolutional layers. Experiments on image classification CNNs show that on average across all networks studied, TRT outperforms a state-of-the-art bit-parallel accelerator by 1:90x without any loss in accuracy while it is 1:17x more energy efficient. TRT requires no network retraining while it enables trading off accuracy for additional improvements in execution performance and energy efficiency. For example, if a 1% relative loss in accuracy is acceptable, TRT is on average 2:04x faster and 1:25x more energy efficient than a conventional bit-parallel accelerator. A Tartan configuration that processes 2-bits at time, requires less area than the 1-bit configuration, improves efficiency to 1:24x over the bit-parallel baseline while being 73% faster for convolutional layers and 60% faster for fully-connected layers is also presented.

연구 동기 및 목표

  • 모든 레이어에 동일한 정밀도를 사용하는 기존 DNN 가속기의 성능 및 에너지 효율성 한계를 해결하기 위해, 레이어별 정밀도 요구사항에 따라 유연하게 대응할 수 있도록 한다.
  • 각 레이어에서 사용하는 정밀도(비트 수)에 따라 실행 시간을 동적으로 조절하여 성능 및 에너지 효율성 향상을 가능하게 한다.
  • 기존 비트-직렬 가속기의 연구를 확장하여 컨볼루션 레이어와 완전 연결 레이어를 모두 효율적으로 지원함으로써, 완전 연결 레이어에서 관찰된 에너지 비효율성을 해결한다.
  • 모델 재학습 없이도 런타임에서 정확도, 성능, 에너지 효율성 간의 실시간 트레이드오프를 가능하게 하는 하드웨어 솔루션을 제공한다.
  • 표준 메모리 인터페이스와 호환되며, 효율적인 메모리 액세스를 지원하면서도 가변 정밀도 연산을 가능하게 한다.

제안 방법

  • 가중치 및 활성화에 대해 1비트 및 다중비트 정밀도 처리를 모두 지원하는 하이브리드 비트-직렬/비트-병렬 기능 유닛 아키텍처를 설계한다.
  • 연속된 직렬 내적(SIP) 유닛을 사용하여 출력 계산의 분할을 가능하게 하여 소규모 레이어에서의 랜드 간 불균형을 줄이고 활용도를 향상시킨다.
  • Judd 등이 제안한 감도 분 析 기반으로 각 레이어별 최적의 정밀도를 결정하는 방법론을 구현한다 [11].
  • 비트-병렬 가속기와 동일한 메모리 인터페이스와 와이어 수를 유지하여 호환성을 확보하고 외부 메모리 대역폭 증가를 방지한다.
  • 실행 시간을 정밀도 p의 역수로 조절하여, 컨볼루션 및 완전 연결 레이어 모두에서 16비트 기준 대비 이상적인 속도 향상 16/p를 달성한다.
  • 추론 중에 정밀도를 동적으로 조정할 수 있도록 구현하여 런타임에서 정확도, 성능, 에너지 효율성 간의 트레이드오프를 가능하게 한다.

실험 결과

연구 질문

  • RQ1DNN의 다양한 레이어에서 요구하는 가변 정밀도를 활용함으로써 하드웨어 가속기가 성능 및 에너지 효율성 향상을 달성할 수 있는가?
  • RQ2기존 비트-직렬 설계에서 관찰된 에너지 비효율성을 해결하기 위해 비트-직렬 처리를 완전 연결 레이어로 효과적으로 확장할 수 있는가?
  • RQ3동적 정밀도 스케일링을 통해 정확도 손실 없이 추론 시간과 에너지 소비를 얼마나 줄일 수 있는가?
  • RQ4하나의 가속기 아키텍처가 다양한 정밀도 요구사항을 가진 컨볼루션 및 완전 연결 레이어를 고성능 메모리 대역폭과 낮은 면적 오버헤드를 유지하면서 효율적으로 처리할 수 있는가?
  • RQ5DNN 추론에서 약간의 정확도 손실을 감수함으로써 성능과 효율성을 향상시킬 경우, 성능 및 에너지 효율성 향상은 어느 정도인가?

주요 결과

  • TRT는 이미지 분류 CNN의 모든 레이어에서 최신 비트-병렬 가속기(DaDN) 대비 평균 1.90배 빠른 속도 향상과 1.17배 높은 에너지 효율성 향상을 달성한다.
  • 완전 연결 레이어에서는 TRT가 DaDN 대비 1.61배 빠른 속도 향상과 1.06배 높은 에너지 효율성 향상을 달성한다.
  • 컨볼루션 레이어에서는 TRT가 DaDN 대비 1.91배 빠른 속도 향상과 1.18배 높은 에너지 효율성 향상을 달성한다.
  • 정확도를 1% 상실함으로써 TRT는 비트-병렬 기준 대비 2.04배 더 빠른 추론 속도와 1.25배 높은 에너지 효율성을 달성한다.
  • 2비트 TRT 구성은 컨볼루션 레이어에서 1비트 기준 대비 73% 더 빠르며, 완전 연결 레이어에서는 60% 더 빠르며, 에너지 효율성은 1.24배 높다.
  • TRT는 정밀도 스케일링을 동적으로 조절할 수 있어 성능 및 에너지 절약으로 직접 연결되며, 추론 워크로드에 대해 새로운 수준의 적응성을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.