[논문 리뷰] Device-Circuit-Architecture Co-Exploration for Computing-in-Memory Neural Accelerators
이 논문은 장치 유형, 회로 토폴로지, 신경망 아키텍처를 동시에 최적화하면서 장치 변동성을 고려하는 계산 메모리(CiM) 신경 가속기용 교차 레이어 공동 탐색 프레임워크인 NACIM을 제안한다. 변동성 인식 학습과 다목적 최적화를 통합함으로써 NACIM은 변동성 하에서 0.45%의 정확도 손실을 기록하며, 최신 상태의 NAS에서 기록하는 76.44%의 손실보다 훨씬 우수한 성능을 달성한다. 또한 16.3 TOPs/W의 에너지 효율성을 확보하여 이전 작업 대비 3.17배 향상되었다.
Co-exploration of neural architectures and hardware design is promising to simultaneously optimize network accuracy and hardware efficiency. However, state-of-the-art neural architecture search algorithms for the co-exploration are dedicated for the conventional von-neumann computing architecture, whose performance is heavily limited by the well-known memory wall. In this paper, we are the first to bring the computing-in-memory architecture, which can easily transcend the memory wall, to interplay with the neural architecture search, aiming to find the most efficient neural architectures with high network accuracy and maximized hardware efficiency. Such a novel combination makes opportunities to boost performance, but also brings a bunch of challenges. The design space spans across multiple layers from device type, circuit topology to neural architecture. In addition, the performance may degrade in the presence of device variation. To address these challenges, we propose a cross-layer exploration framework, namely NACIM, which jointly explores device, circuit and architecture design space and takes device variation into consideration to find the most robust neural architectures. Experimental results demonstrate that NACIM can find the robust neural network with 0.45% accuracy loss in the presence of device variation, compared with a 76.44% loss from the state-of-the-art NAS without consideration of variation; in addition, NACIM achieves an energy efficiency up to 16.3 TOPs/W, 3.17X higher than the state-of-the-art NAS.
연구 동기 및 목표
- von-Neumann 아키텍처의 성능 저하 문제를 계산 메모리(CiM)를 활용하여 메모리 벽을 초월함으로써 해결하고자 한다.
- 최대 하드웨어 효율성과 네트워크 정확도를 확보하기 위해 장치, 회로, 신경망 아키텍처 설계 레이어 간의 통합 최적화를 가능하게 하고자 한다.
- 신규 비버니시브 메모리 장치에서 발생하는 장치 변동성이 신경망 추론 정확도에 미치는 영향을 완화하고자 한다.
- 정확도, 에너지, 지연, 면적, 하드웨어 수명을 동시에 최적화하는 확장 가능한 다목적 공동 탐색 프레임워크를 개발하고자 한다.
- 변동성 인식 학습을 통한 아키텍처 탐색이 고정 아키텍처 접근 방식보다 훨씬 더 강력하고 효율적인 신경 가속기를 도출할 수 있음을 입증하고자 한다.
제안 방법
- NACIM은 장치 유형, 회로 토폴로지, 신경망 아키텍처 설계 공간을 동시에 탐색하는 다목적 강화학습 프레임워크를 사용한다.
- 백프로파게이션 동안 장치 비이상성(비이상성)을 시뮬레이션하는 변동성 인식 학습 절차를 통합하여 내성적 강건성을 향상시킨다.
- 지연, 면적, 에너지를 가중치로 포함한 정규화된 하드웨어 효율성과 추론 정확도를 조합한 보상 함수를 사용한다.
- 장치 변동성의 영향을 추정하기 위해 몬테카를로 샘플링을 사용하여 장치 파rameter 분포 전반에서 강건성을 확보한다.
- 탐색 공간에는 VGG-11, ResNet 유사 구조, U-Net 스타일 인코더 등 다양한 신경망 아키텍처가 포함되어 있어 효율적이고 작업 특화된 설계 탐색이 가능하다.
- EDP 및 면적과 같은 하드웨어 지표는 정규화되어 하드웨어 효율성 목표의 일부로 사용되어 파레토 최적의 트레이드오���을 가능하게 한다.
실험 결과
연구 질문
- RQ1CiM 가속기에서 장치, 회로, 신경망 아키텍처 설계 공간의 공동 탐색이 전통적인 NAS보다 더 높은 정확도와 하드웨어 효율성을 달성할 수 있는가?
- RQ2장치 변동성은 CiM 하드웨어에 매핑된 신경망의 추론 정확도에 어떤 영향을 미치며, 이는 학습 중에 보완될 수 있는가?
- RQ3비이상적인 장치 행동 하에서 아키텍처 탐색은 CiM 기반 신경 가속기의 강건성과 효율성에 어떤 영향을 미치는가?
- RQ4통합 프레임워크는 CiM 가속기에서 정확도, 에너지, 지연, 면적, 하드웨어 수명을 동시에 최적화할 수 있는가?
- RQ5제안된 NACIM 프레임워크는 다양한 백본 아키텍처와 기계학습 작업에 대해 어떻게 확장 가능한가?
주요 결과
- NACIM은 16.3 TOPs/W의 에너지 효율성을 달성하여 최신 상태의 NAS 방법 대비 3.17배 향상되었다.
- 장치 변동성 하에서 NACIM은 오직 0.45%의 정확도 손실을 기록했으며, 변동성 무시 학습을 사용한 NAS 대비 76.44%의 손실에 비해 훨씬 뛰어난 강건성을 입증했다.
- ResNet 유사 백본을 사용한 CIFAR-10에서 NACIM은 기준값(72.18%)에서 정확도를 73.45%로 향상시키며 면적은 23.3% 감소하고 EDP는 52.4% 감소시켰다.
- VLS 객체 세그멘테이션 작업에서 NACIM은 93.12%의 정확도를 기록했으며 면적은 4.75×10⁸ μm², EDP는 5.54×10¹⁵ pJ·ns를 기록하여 정확도 및 효율성 면에서 기준값을 모두 초월했다.
- 프레임워크는 VGG-11 같은 큰 백본보다 더 작은 더 효율적인 아키텍처(예: RLS)를 성공적으로 식별하여 더 높은 정확도와 더 낮은 EDP를 달성했다.
- 변동성 인식 학습은 추론 강건성을 크게 향상시켰으며, RLS, VLS, EDS 작업에서 각각 정확도 향상 9.8%, 9.6%, IOU 향상 0.525를 기록하여 변동성 무시 학습 대비 유의미한 성능 향상을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.