Skip to main content
QUICK REVIEW

[논문 리뷰] Energy-Efficient Accelerator Design for Deformable Convolution Networks

Dawen Xu, Cheng Chu|arXiv (Cornell University)|2021. 07. 06.
Advanced Neural Network Applications참고 문헌 36인용 수 4
한 줄 요약

이 논문은 표준 NNA에서 6.6%의 면적 오버헤드만으로, 불규칙한 메모리 액세스를 처리하기 위해 런타임 타일 기반 의존성 추적 및 스케줄링을 도입하고, 2차원 배열에서 병렬 이중선형 보간을 실현하며, 처리 단계를 융합하여 데이터 이동을 줄이는 전용 신경망 가속기(DCNA)를 제안한다. DCNA는 GPU 대비 3배 빠른 성능과 18.6배 높은 에너지 효율을 달성하였으며, ARM+TPU 대비 45×–546× 빠른 성능을 보이며, 표준 NNA 기반에서 높은 성능과 에너지 효율성을 동시에 확보한다.

ABSTRACT

Deformable convolution networks (DCNs) proposed to address the image recognition with geometric or photometric variations typically involve deformable convolution that convolves on arbitrary locations of input features. The locations change with different inputs and induce considerable dynamic and irregular memory accesses which cannot be handled by classic neural network accelerators (NNAs). Moreover, bilinear interpolation (BLI) operation that is required to obtain deformed features in DCNs also cannot be deployed on existing NNAs directly. Although a general purposed processor (GPP) seated along with classic NNAs can process the deformable convolution, the processing on GPP can be extremely slow due to the lack of parallel computing capability. To address the problem, we develop a DCN accelerator on existing NNAs to support both the standard convolution and deformable convolution. Specifically, for the dynamic and irregular accesses in DCNs, we have both the input and output features divided into tiles and build a tile dependency table (TDT) to track the irregular tile dependency at runtime. With the TDT, we further develop an on-chip tile scheduler to handle the dynamic and irregular accesses efficiently. In addition, we propose a novel mapping strategy to enable parallel BLI processing on NNAs and apply layer fusion techniques for more energy-efficient DCN processing. According to our experiments, the proposed accelerator achieves orders of magnitude higher performance and energy efficiency compared to the typical computing architectures including ARM, ARM+TPU, and GPU with 6.6\% chip area penalty to a classic NNA.

연구 동기 및 목표

  • 기존 신경망 가속기(NNA)와 호환되지 않는 불규칙적이고 동적인 메모리 액세스 패턴을 갖는 변형 컨볼루션 네트워크(DCN)의 문제를 해결한다.
  • 기존 NNA에서 이중선형 보간(BLI)을 네이티브로 지원하지 않아 DCN에서 변형된 특징을 계산하는 데 필수적인 BLI 기능을 보완한다.
  • 모델 재학습이나 정확도 손실 없이 표준 및 변형 컨볼루션을 모두 지원하는 에너지 효율적인 가속기를 설계한다.
  • 타일 기반 스케줄링과 계층 융합을 통해 片상 메모리 재사용을 가능하게 하여 데이터 이동과 메모리 대역폭 부담을 최소화한다.
  • 기존 NNA 아키텍처와의 호환성을 유지하면서도 DCN에서 고성능 및 고에너지 효율성을 달성한다.

제안 방법

  • 입력 타일과 출력 타일 간의 런타임 의존성을 추적하기 위해 타일 의존성 테이블(TDT)을 도입하여 변형 컨볼루션에서 발생하는 불규칙한 메모리 액세스를 동적으로 처리한다.
  • TDT를 활용하여 입력 타일 재사용을 분석함으로써 데이터 재사용을 최적화하고 중복 메모리 액세스를 줄이는 片상 타일 스케줄러를 개발한다.
  • 일반 프로세서에 의존하지 않고 2차원 처리 어레이에 이중선형 보간(BLI) 연산을 병렬 실행할 수 있도록 새로운 매핑 전략을 제안한다.
  • 각 변형 컨볼루션 연산 내의 처리 단계를 융합하여 중간 데이터를 DRAM으로 이동하는 양을 줄이고 片상 데이터 재사용을 향상시킨다.
  • 계산과 메모리 액세스를 분리하기 위해 타일 기반 데이터 분할을 적용하여 효율적인 스케줄링과 버퍼링을 가능하게 하며, DRAM 에너지 소비를 최소화한다.
  • 의존성 추적의 세분성과 메모리 액세스 효율성 간의 균형을 고려해 타일 크기를 최적화하며, 더 작은 타일은 더 큰 최적화 잠재력을 제공한다.

실험 결과

연구 질문

  • RQ1변형 컨볼루션 네트워크에서 발생하는 불규칙적이고 동적인 메모리 액세스 패턴을 하드웨어 가속기에서 효율적으로 관리할 수 있는 방법은 무엇인가?
  • RQ2일반 프로세서에 의존하지 않고 신경망 가속기에서 이중선형 보간(BLI) 연산을 병렬 실행하기 위한 효과적인 방법은 무엇인가?
  • RQ3DCN에서 타일 간 데이터 재사용을 최대화하여 메모리 대역폭과 DRAM 에너지 소비를 줄일 수 있는 방법은 무엇인가?
  • RQ4최소한의 면적 오버헤드로 표준 NNA에 변형 컨볼루션 지원을 통합함으로써 성능과 에너지 효율성을 얼마나 향상시킬 수 있는가?
  • RQ5계층 융합과 타일 기반 스케줄링이 함께 작용하여 중간 데이터 이동을 줄이고 DCN 워크로드에서의 가속기 효율을 향상시킬 수 있는가?

주요 결과

  • 제안된 DCNA는 변형 컨볼루션을 비효율적인 일반 프로세서에 위임하는 ARM+TPU 아키텍처 대비 45×에서 546× 높은 성능을 달성한다.
  • 대표적인 DCN 모델인 VGG19와 SegNet-F에서 GPU 대비 DCNA는 3배 빠른 성능과 18.6배 높은 에너지 효율성을 확보한다.
  • 타일 스케줄링 메커니즘은 기존 비트 벡터 의존성 추적만을 사용하는 베이스라인 대비 평균 40.7%의 메모리 액세스 감소를 이룬다.
  • 작은 타일 크기(예: 8×8)는 더 나은 의존성 추적과 데이터 재사용 덕분에 가장 낮은 정규화된 DRAM 에너지 소비를 기록한다.
  • 계층 융합은 VGG19/SegNet-F에서 중간 데이터 전송을 최소화함으로써 에너지 소비를 20% 이상 감소시키며, 특히 큰 변형 컨볼루션 연산에 유리하다.
  • DCNA는 기준 NNA 대비 단지 6.6%의 칩 면적 패널티만을 유발하여 DCN 가속화를 위한 높은 면적 효율성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.