Skip to main content
QUICK REVIEW

[논문 리뷰] Scale-Dropout: Estimating Uncertainty in Deep Neural Networks Using Stochastic Scale

Soyed Tuhin Ahmed, Kamal Danouchi|arXiv (Cornell University)|2023. 11. 27.
Adversarial Robustness in Machine Learning인용 수 5
한 줄 요약

이 논문은 이진 신경망(BNNs)을 위한 새로운 정규화 기법인 Scale-Dropout을 제안한다. 이 기법은 개별 뉴런 대신 전체 스케일 벡터를 확률적으로 드롭아웃함으로써, 모델 크기와 관계없이 단일 확률적 유닛만으로도 효율적인 몬테카를로 추론을 가능하게 한다. 이 방법은 스핀트로닉스 기반의 메모리 내 연산(CIM) 아키텍처에서 최대 100배의 에너지 절감을 이끌어내며, 기존 최고 수준의 BNNs 대비 최대 100%의 OOD 탐지 성능과 1.33% 높은 예측 정확도를 달성한다.

ABSTRACT

Uncertainty estimation in Neural Networks (NNs) is vital in improving reliability and confidence in predictions, particularly in safety-critical applications. Bayesian Neural Networks (BayNNs) with Dropout as an approximation offer a systematic approach to quantifying uncertainty, but they inherently suffer from high hardware overhead in terms of power, memory, and computation. Thus, the applicability of BayNNs to edge devices with limited resources or to high-performance applications is challenging. Some of the inherent costs of BayNNs can be reduced by accelerating them in hardware on a Computation-In-Memory (CIM) architecture with spintronic memories and binarizing their parameters. However, numerous stochastic units are required to implement conventional dropout-based BayNN. In this paper, we propose the Scale Dropout, a novel regularization technique for Binary Neural Networks (BNNs), and Monte Carlo-Scale Dropout (MC-Scale Dropout)-based BayNNs for efficient uncertainty estimation. Our approach requires only one stochastic unit for the entire model, irrespective of the model size, leading to a highly scalable Bayesian NN. Furthermore, we introduce a novel Spintronic memory-based CIM architecture for the proposed BayNN that achieves more than $100 imes$ energy savings compared to the state-of-the-art. We validated our method to show up to a $1\%$ improvement in predictive performance and superior uncertainty estimates compared to related works.

연구 동기 및 목표

  • 과도한 확률적 유닛과 메모리 액세스로 인해 엣지 디바이스에서 베이지안 신경망(BayNNs)의 하드웨어 오버헤드가 높다는 문제를 해결하기 위해.
  • BayNNs의 확률적 유닛 수를 뉴런 수준에서 레이어 수준의 스케일 벡터 수준으로 줄여, BNNs에서 확장 가능한 불확실성 추정을 가능하게 하기 위해.
  • 최소한의 외부 회로 변경으로도 확률적 스케일링을 지원하는 하드웨어 효율적인 스핀트로닉스 메모리 기반의 메모리 내 연산(CIM) 아키텍처를 개발하기 위해.
  • 모델 파라미터나 계산 복잡도를 증가시키지 않으면서도 BNNs의 불확실성 정량화 및 예측 성능을 향상시키기 위해.
  • SOT-MRAM 기반의 CIM을 활용해 자원 제약이 있는 엣지 디바이스에서 불확실성 인식 BNNs의 에너지 효율적인 구현을 가능하게 하기 위해.

제안 방법

  • 확률 p로 BNN 레이어의 전체 스케일 벡터를 확률적으로 드롭아웃하는 정규화 기법인 Scale-Dropout을 제안하여 학습 중 공적응을 감소시킨다.
  • 몬테카를로 스케일 드롭아웃(MC-Scale Dropout)을 도입하여, 확률적 스케일 벡터를 사용해 몬테카를로 샘플링을 통해 예측 불확실성을 추정하는 베이지안 추론 방법을 제시한다.
  • 스케일 벡터를 학습 가능한 파라미터로 통합하여 양자화 오차를 감소시키고 추론 시 안정적인 확률적 스케일링을 가능하게 한다.
  • 메모리 어레이의 변경 없이 외부 회로를 통해 확률성을 주입하는 SOT-MRAM 기반의 메모리 내 연산(CIM) 아키텍처를 설계한다.
  • SOT-MRAM의 높은 저항 동적 범위(최대 몇 MΩ)를 활용해 대규모 크로스바 어레이에서 확장 가능하고 에너지 효율적인 베이지안 추론을 지원한다.
  • 크로스바 기반의 CIM 아키텍처에 구현하여 행렬-벡터 곱셈을 메모리 내에서 수행함으로써 데이터 이동과 에너지 소비를 최소화한다.
Figure 1: Several nodes (neurons) a) at training time that are scaled with a probability of $p$ and dropped (ignored) with a probability of $1-p$ , b) At test time, if point estimate prediction is preferred, all the nodes are always scaled. However, for Bayesian inference, all nodes behave similarly
Figure 1: Several nodes (neurons) a) at training time that are scaled with a probability of $p$ and dropped (ignored) with a probability of $1-p$ , b) At test time, if point estimate prediction is preferred, all the nodes are always scaled. However, for Bayesian inference, all nodes behave similarly

실험 결과

연구 질문

  • RQ1모델당 단일 확률적 유닛으로 뉴런 수준의 드롭아웃 유닛을 대체할 수 있을까? 이는 불확실성 추정 품질을 유지할 수 있는가?
  • RQ2전체 스케일 벡터의 확률적 스케일링이 기존의 MC-Dropout 대비 BNN의 불확실성 정량화 및 예측 성능에 어떤 영향을 미치는가?
  • RQ3최소한의 외부 회로 변경만을 가진 스핀트로닉스 메모리 기반의 CIM 아키텍처가 베이지안 BNN의 에너지 효율적인 추론을 얼마나 잘 지원할 수 있는가?
  • RQ4장치의 변동성과 메모리 정밀도가 제안된 Scale-Dropout 기법의 강건성과 확장성에 어떤 영향을 미치는가?
  • RQ5제안된 방법이 최고 수준의 BNN 및 BayNN 대비 뛰어난 분포 외(OOD) 탐지 및 예측 정확도를 달성할 수 있는가?

주요 결과

  • 제안된 MC-Scale Dropout 방법은 CIFAR-10에서 최대 100%의 분포 외(OOD) 탐지율을 달성하여 이전 방법들을 뛰어넘는 성능을 보였다.
  • VGG 아키텍처에서 밝기 오염으로 인해 정확도가 6.89% 감소했음에도 불구하고, 최악의 경우 OOD 탐지율이 29.53%로 유지되었다.
  • 최고 수준의 이진 베이지안 신경망 대비 예측 성능을 최대 1.33% 향상시켰다.
  • 기존 BNN 성능을 최대 0.26% 향상시켜, 불확실성 인식 학습을 통한 일반화 능력 향상이 입증되었다.
  • SOT-MRAM 기반의 CIM 아키텍처는 최고 수준의 기술과 비교해도 최소한 100배 이상의 에너지 절감을 달성했으며, 외부 회로 변경만으로도 가능했다.
  • 실험 분석을 통해 1000개의 몬테카를로 샘플을 사용할 경우 클래스 간 사후 분포가 가우시안 분포에 수렴하는 것으로 확인되어, 베이지안 근사의 타당성이 검증되었다.
Figure 2: Spin Scale-Dropout Module based on SOT MTJ.
Figure 2: Spin Scale-Dropout Module based on SOT MTJ.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.