Skip to main content
QUICK REVIEW

[논문 리뷰] An Energy-efficient Time-domain Analog VLSI Neural Network Processor Based on a Pulse-width Modulation Approach

Masatoshi Yamaguchi, Goki Iwamoto|arXiv (Cornell University)|2019. 02. 16.
Advanced Memory and Neural Computing참고 문헌 25인용 수 7
한 줄 요약

이 논문은 이진 신경망에서 에너지 효율적인 가중합 계산을 위한 펄스폭 변조(PWM)를 사용하는 시간 도메인 아날로그 VLSI 신경망 프로세서를 제안한다. 서브스브리티컬 MOSFET와 일시적 RC 충전/방전을 활용하여 250-nm CMOS 기술을 사용함에도 불구하고 300 TOPS/W의 에너지 효율성을 달성하였으며, 이는 최신 디지털 AI 프로세서보다 30배 이상 높다. 향후 고도화된 공정 기술을 적용할 경우 1,000 TOPS/W 이상의 효율성도 가능할 전망이다.

ABSTRACT

A time-domain analog-weighted-sum calculation model based on a pulse-width modulation (PWM) approach is proposed. The proposed calculation model can be applied to any types of network structure including multi-layer feedforward networks. We also propose very large-scale integrated (VLSI) circuits to implement the proposed model. Unlike the conventional analog voltage or current mode circuits used in computing-in-memory circuits, our time-domain analog circuits use transient operation in charging/discharging processes to capacitors. Since the circuits can be designed without operational amplifiers, they can be operated with extremely low power consumption. However, they have to use very high-resistance devices, on the order of giga-ohms. We designed a CMOS VLSI chip to verify weighted-sum operation based on the proposed model with binary weights, which realizes the BinaryConnect model. In the chip, memory cells of static-random-access memory (SRAM) are used for synaptic connection weights. High-resistance operation was realized by using the subthreshold operation region of MOS transistors unlike the ordinary computing-in-memory circuits. The chip was designed and fabricated using a 250-nm fabrication technology. Measurement results showed that energy efficiency for the weighted-sum calculation was 300~TOPS/W (Tera-Operations Per Second per Watt), which is more than one order of magnitude higher than that in state-of-the-art digital AI processors, even though the minimum width of interconnection used in this chip was several times larger than that in such digital processors. If state-of-the-art VLSI technology is used to implement the proposed model, an energy efficiency of more than 1,000~TOPS/W will be possible. For practical applications, development of emerging analog memory devices such as ferroelectric-gate field effect transistors (FeFETs) is necessary.

연구 동기 및 목표

  • 엣지 장치에서의 디지털 AI 프로세서 고전력 소비 문제를 해결하기 위해 신경망 추론을 위한 저전력 아날로그 VLSI 솔루션을 개발한다.
  • 기존 아날로그 전압/전류 모드 회로의 한계를 극복하기 위해 일시적 RC 응답을 활용한 시간 도메인 아날로그 계산 방식을 도입한다.
  • PWM 인코딩된 신호와 서브스브리티컬 MOSFET를 사용하여 이진 신경망을 위한 가중합(MAC) 연산에서 초고효율 에너지 효율성을 달성한다.
  • 100×10 시냅스를 구현한 CMOS VLSI 칩을 통해 TACT-PWM 기반 접근법의 실현 가능성을 검증한다. 이 칩은 300 TOPS/W의 효율성을 달성한다.
  • 서브스브리티컬 동작에서의 장치 변동성을 보완하기 위해 향후 유형의 아날로그 메모리 장치(예: FeFET)가 필요하다는 점을 규명한다.

제안 방법

  • 펄스폭 변조(PWM) 기반의 시간 도메인 아날로그 가중합 모델을 제안한다. 여기서 입력 펄스의 폭이 신호의 진폭을 나타내며, 커패시터의 충전이 가중합을 나타낸다.
  • 스위치드 커펌턴트 소스(SCR)를 사용한 RC 회로를 통해 계산을 구현한다. 커패시터에 축적된 전하가 가중합에 해당한다.
  • MOSFET의 서브스브리티컬 동작을 활용하여 고저항 요소(기가오옴 범위)를 생성함으로써 오퍼에이프 amp 없이 저전력 동작을 구현한다.
  • SRAM 기반 메모리 셀을 사용한 250-nm CMOS VLSI 칩을 설계하며, ReLU 활성화를 위한 비교기 회로를 포함한다.
  • TACT-PWM 접근법을 사용해 BinaryConnect 네트워크를 구현함으로써 커패시터의 일시적 충전/방전을 통해 효율적인 MAC 연산을 수행한다.
  • 다중 측정 평균을 통해 타이밍 제트를 감소시키고 출력 펄스 폭의 정밀도를 향상시킨다.

실험 결과

연구 질문

  • RQ1PWM와 일시적 RC 응답을 기반으로 한 시간 도메인 아날로그 VLSI 아키텍처가 신경망 추론에서 디지털 AI 프로세서보다 현저히 높은 에너지 효율성을 달성할 수 있는가?
  • RQ2서브스브리티컬 MOSFET 동작이 오퍼에이프 amp 없이 아날로그 가중합 회로에서 초저전력 소비를 가능하게 하는가?
  • RQ3250-nm 공정 기술과 이진 가중치를 사용한 TACT-PWM 모델을 구현한 CMOS VLSI 칩의 실현 가능한 에너지 효율은 어느 정도인가?
  • RQ4서브스브리티컬 MOSFET의 장치 변동성이 계산 정밀도에 얼마나 영향을 미치며, 이를 어떻게 보완할 수 있는가?
  • RQ5고도화된 VLSI 기술과 FeFET와 같은 신개념 아날로그 메모리 장치를 적용할 경우 성능 향상은 어느 정도 기대할 수 있는가?

주요 결과

  • 제작된 CMOS VLSI 칩은 300 TOPS/W의 전력 효율을 달성하였으며, 이는 최신 디지털 AI 프로세서보다 30배 이상 높다.
  • 현대 디지털 AI 칩보다 최소 치수 약 10배 큰 250-nm 공정을 사용했음에도 불구하고 300 TOPS/W의 에너지 효율을 달성하였다.
  • 측정 결과, ReLU 활성화 후 출력 펄스 폭의 최대 오차는 8%이며 평균 오차는 1.5%로 나타나 이진 네트워크에 있어 수용 가능한 정밀도를 확보하였다.
  • 출력 펄스 폭의 타이밍 제트는 ±20 ns였으며, 최대 펄스 폭 2 μs 기준 약 ±1%의 정밀도에 해당한다.
  • 이론적 스케일링 결과, 최신 VLSI 기술을 적용할 경우 에너지 효율이 1,000 TOPS/W 이상 또는 1 POPS/W 이상으로 향상될 수 있음을 시사한다.
  • 뉴런 회로의 전력 소모가 시냅스 어레이와 유사한 수준이었으며, 이는 비교기 회로가 향후 효율 향상의 주요 병목 요소임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.