[논문 리뷰] High Area/Energy Efficiency RRAM CNN Accelerator with Kernel-Reordering Weight Mapping Scheme Based on Pattern Pruning
이 논문은 패턴 프루닝 기반의 새로운 커널 재정렬 가중치 매핑 기법을 사용한 고면적 및 고에너지 효율성 RRAM 기반 CNN 가속기 아키텍처를 제안한다. 패턴 프루닝을 통한 구조적 희박성과 연산 단위(OU) 메커니즘을 활용하여, 기준 방법 대비 최대 5.20배의 크로스바 면적 효율성, 2.15배의 에너지 효율성, 1.35배의 성능 가속도를 달성하면서 정확도 손실 최소화를 이룬다.
Resistive Random Access Memory (RRAM) is an emerging device for processing-in-memory (PIM) architecture to accelerate convolutional neural network (CNN). However, due to the highly coupled crossbar structure in the RRAM array, it is difficult to exploit the sparsity of the network in RRAM-based CNN accelerator. To optimize the weight mapping of sparse network in the RRAM array and achieve high area and energy efficiency, we propose a novel weight mapping scheme and corresponding RRAM-based CNN accelerator architecture based on pattern pruning and Operation Unit(OU) mechanism. Experimental results show that our work can achieve 4.16x-5.20x crossbar area efficiency, 1.98x-2.15x energy efficiency, and 1.15x-1.35x performance speedup in comparison with the traditional weight mapping method.
연구 동기 및 목표
- 희박하고 비정규적인 구조를 가진 가중치를 처리할 때 RRAM 기반 CNN 가속기의 낮은 면적 및 에너지 효율성 문제를 해결하기 위해.
- 정확도를 희생시키지 않고 RRAM 크로스바 어레이에서 네트워크의 희박성을 효과적으로 활용하기 위해.
- 구조적 희박성과 효율적인 계산을 동시에 지원하는 하드웨어 인식 가중치 매핑 기법을 설계하기 위해.
- 패턴 프루닝과 OU 기반 계산 메커니즘의 조합을 통해 고성능, 고면적, 고에너지 효율성을 달성하기 위해.
제안 방법
- 층당 최대 12개의 패턴을 가진 구조적이고 하드웨어 우수한 희박성 패턴을 생성하는 패턴 프루닝 알고리즘을 도입하여 RRAM 크로스바에서의 효율적 매핑을 가능하게 한다.
- 출력 채널 인덱스 기반으로 각 입력 채널 내 필터를 재정렬하는 커널 재정렬 가중치 매핑 기법을 개발하여 유사한 패턴을 그룹화하고 크로스바 활용도를 감소시킨다.
- 세분화된 워드라인 및 비트라인 활성화를 가능하게 하는 연산 단위(OU) 메커니즘을 도입하여, 비영인 패턴에 대해서만 선택적 계산을 수행한다.
- 입력 전처리 모듈에 전부 영인 패턴 탐지 모듈을 통합하여 불필요한 ADC/DAC 변환을 생략하고 동적 에너지를 절감한다.
- 커널 출력 채널 위치와 패턴 형상 정보를 인덱스로 저장하여 RRAM에 영인 가중치 패턴을 저장하지 않고도 정확한 데이터 라우팅을 가능하게 한다.
- 제안된 매핑 기법을 지원하고 가중치 및 활성화맵의 희박성을 모두 활용하는 완전한 RRAM 기반 CNN 가속기 아키텍처를 설계한다.
실험 결과
연구 질문
- RQ1패턴 프루닝에서 유도된 구조적 희박성은 어떻게 RRAM 크로스바 어레이에서 효과적으로 활용되어 면적 및 에너지 효율성을 향상시킬 수 있는가?
- RQ2커널 재정렬과 OU 기반 계산은 희박한 CNN 추론에서 크로스바 활용도와 에너지 소비에 어떤 영향을 미치는가?
- RQ3패턴 프루닝은 정확도 손실 최소화를 유지하면서도 RRAM 기반 PIM 아키텍처와 호환 가능한 높은 희박성을 달성할 수 있는가?
- RQ4기본적인 가중치 매핑 방식과 비교했을 때 제안된 매핑 기법은 면적, 에너지, 성능 효율성 측면에서 어떤가?
주요 결과
- 제안된 패턴 프루닝 기반 매핑 기법은 기준 방법 대비 4.16배에서 5.20배의 크로스바 면적 효율성 향상을 달성했으며, RRAM 크로스바 면적을 76.0%에서 80.8%까지 절감했다.
- CIFAR-10, CIFAR-100, ImageNet 데이터셋 전반에서 에너지 효율성이 1.98배에서 2.15배 향상되었으며, ADC 에너지 소비가 주요 제약 요소로 나타났다.
- 성능 가속도는 1.15배에서 1.35배 달성되었으며, 주로 전부 영인 패턴 계산의 제거와 메모리 액세스 감소로 인한 것이다.
- 커널 재정렬에 따른 인덱스 오버헤드는 총 모델 크기의 12.2%에 불과하며(729.5KB–1013.5KB), 압축된 모델 크기 대비 허용 가능한 수준이다.
- 이론적 최적 면적 효율성에 근접한 성능을 달성했으며, CIFAR-10의 경우 이론 최대치(86.03%)에 매우 가까운 결과를 보여, 희박성의 효과적 활용을 입증했다.
- ImageNet에서의 성능은 패턴 프루닝 결과가 다소 열악하여 희박도가 낮고 패턴 수가 많아 매핑 효율성이 떨어져 상대적으로 낮은 성능을 기록했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.