Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Random Forest with Ferroelectric Analog Content Addressable Memory

Xunzhao Yin, Franz Müller|arXiv (Cornell University)|2021. 10. 06.
Ferroelectric and Negative Capacitance Devices참고 문헌 12인용 수 11
한 줄 요약

이 논문은 딥 랜덤 포레스트(DRF)를 위한 에너지 효율적이고 고속의 연관 검색을 가능하게 하는 페로일렉트릭 아날로그 콘텐츠어드레스블메모리(FeFET ACAM) 기반 가속기 아키텍처를 제안한다. 결정 트리 분할 분류 경계를 FeFET의 아날로그 극화 상태로 저장함으로써, CPU/ReRAM 기반 DRF 가속기 대비 에너지 소모와 지연 시간에서 각각 약 10⁶×/16× 및 약 10⁶×/2.5× 향상된다.

ABSTRACT

Deep random forest (DRF), which incorporates the core features of deep learning and random forest (RF), exhibits comparable classification accuracy, interpretability, and low memory and computational overhead when compared with deep neural networks (DNNs) in various information processing tasks for edge intelligence. However, the development of efficient hardware to accelerate DRF is lagging behind its DNN counterparts. The key for hardware acceleration of DRF lies in efficiently realizing the branch-split operation at decision nodes when traversing a decision tree. In this work, we propose to implement DRF through simple associative searches realized with ferroelectric analog content addressable memory (ACAM). Utilizing only two ferroelectric field effect transistors (FeFETs), the ultra-compact ACAM cell can perform a branch-split operation with an energy-efficient associative search by storing the decision boundaries as the analog polarization states in an FeFET. The DRF accelerator architecture and the corresponding mapping of the DRF model to the ACAM arrays are presented. The functionality, characteristics, and scalability of the FeFET ACAM based DRF and its robustness against FeFET device non-idealities are validated both in experiments and simulations. Evaluation results show that the FeFET ACAM DRF accelerator exhibits 10^6x/16x and 10^6x/2.5x improvements in terms of energy and latency when compared with other deep random forest hardware implementations on the state-of-the-art CPU/ReRAM, respectively.

연구 동기 및 목표

  • 딥 랜덤 포레스트(DRF)에 대한 효율적인 하드웨어 가속이 부족한 문제를 해결하기 위해, 엣지 장치에 적합한 경량이고 해석 가능한 AI 모델을 제공하기 위함이다.
  • 자원 제약이 있는 IoT 환경에서 DNN의 높은 에너지 소비와 지연 시간 문제를 해결하기 위함이다.
  • 페로일렉트릭 아날로그 콘텐츠어드레스블메모리(ACAM)를 활용해 효율적이고 확장 가능하며 강건한 DRF 추론을 실현하기 위함이다.
  • FeFET 기반 ACAM이 결정 트리의 분할 연산을 높은 정밀도와 낮은 면적 비용으로 수행할 수 있음을 입증하기 위함이다.
  • FeFET 장치의 비이상적 특성, 예를 들어 임계 전압 변동과 공정 변동에 대한 시스템의 강건성을 검증하기 위함이다.

제안 방법

  • 결정 경계 임계치를 아날로그 극화 상태로 저장하기 위해 페로일렉트릭 필드효과트랜지스터(FeFET)를 사용하여 DRF를 구현한다.
  • 결정 트리의 분할 결정을 위한 연관 검색을 수행하기 위해 오직 두 개의 FeFET만을 사용한 초소형 ACAM 셀을 설계한다.
  • DRF 모델을 ACAM 어레이에 매핑하여 추론 중 병렬적이고 에너지 효율적인 패턴 매칭을 가능하게 한다.
  • 두 단계 검색 전략을 사용한다: 먼저 가장 중요도가 높은 비트(MSB) 범위를 식별하고, 그 다음에 가장 낮은 비트(LSB) M개를 통해 정밀한 임계치 매칭을 정밀화한다.
  • 매칭 라인 전류 방출을 감지하기 위해 센스 앰프를 사용하며, 어레이 크기와 누설 전류에 따라 타이밍을 조정한다.
  • 실제 장치 비이상적 특성 하에서 SPICE 시뮬레이션과 실험적 특성 분석을 통해 기능성과 강건성을 검증한다.

실험 결과

연구 질문

  • RQ1FeFET 기반 아날로그 CAM은 딥 랜덤 포레스트 내 결정 트리의 분할 연산을 효율적으로 가속화하는 데 사용될 수 있는가?
  • RQ2기존의 CPU 및 ReRAM 기반 DRF 가속기 대비 제안된 FeFET ACAM 기반 DRF 가속기는 에너지 소비와 지연 시간에서 어떤 차이를 보이는가?
  • RQ3FeFET 장치의 변동, 예를 들어 임계 전압(VTH) 불일치와 공정 변동에 대해 시스템은 어느 정도 강건한가?
  • RQ4제한된 정밀도를 가진 FeFET ACAM 셀을 사용하여 분할 임계치의 정밀도를 연장할 수 있는가?
  • RQ5실제 데이터셋인 MNIST와 SEMG에서 결함 경계의 변동이 DRF 분류 정확도에 어떤 영향을 미치는가?

주요 결과

  • FeFET ACAM DRF 가속기는 최신 CPU 기반 DRF 구현 대비 약 10⁶×의 에너지 효율 향상과 약 16×의 지연 시간 감소를 달성한다.
  • ReRAM 기반 DRF 가속기 대비 약 10⁶×의 에너지 효율 향상과 약 2.5×의 지연 시간 감소를 달성한다.
  • FeFET 임계 전압 변동 조건에서도 높은 분류 정확도를 유지하며, 메모리 창의 4% 이내의 표준 편차를 보이며 장치 비이상적 특성에 강건함을 입증한다.
  • MNIST 데이터셋의 경우, 이진 입력이 작은 임계치 이동에 대해 강건하므로 결정 경계 변동 조건에서도 정확도가 안정적으로 유지된다.
  • SEMG 데이터셋의 경우, 결정 경계 변동이 메모리 창의 7%를 초과할 때에야 정확도 저하가 눈에 띄게 나타나며, 이는 FeFET에서 실제로 관측된 4%의 변동보다 높은 수준이다.
  • 128×128 FeFET ACAM 어레이가 에이전시 및 뇌파/PET-CT 간질 탐지에 대해 3비트 정밀도 랜덤 포레스트를 성공적으로 구현하였으며, 분류당 2.91 pJ의 에너지 소모와 1.9 ns의 분류 시간을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.