[논문 리뷰] X-TIME: An in-memory engine for accelerating machine learning on tabular data with CAMs
X-TIME는 고정밀 아날로그 콘텐츠 주소 가능 메모리(aCAMs)를 사용하여 트리 기반 기계학습 모델(예: XGBoost 및 CatBoost)의 추론을 가속화하는 새로운 내장형 컴퓨팅 아키텍처를 제안한다. 결정 트리를 아날로그 CAM 어레이에 직접 매핑하여 기능 값이 저장된 결함 범위와 동시에, 현장에서 비교함으로써 X-TIME는 19W의 전력 소비로 V100 GPU 대비 9740배 빠른 지연 시간과 119배 높은 처리량을 달성하며, 앙상블 평균을 통해 하드웨어 변동성에 대한 내성을 확보한다.
Structured, or tabular, data is the most common format in data science. While deep learning models have proven formidable in learning from unstructured data such as images or speech, they are less accurate than simpler approaches when learning from tabular data. In contrast, modern tree-based Machine Learning (ML) models shine in extracting relevant information from structured data. An essential requirement in data science is to reduce model inference latency in cases where, for example, models are used in a closed loop with simulation to accelerate scientific discovery. However, the hardware acceleration community has mostly focused on deep neural networks and largely ignored other forms of machine learning. Previous work has described the use of an analog content addressable memory (CAM) component for efficiently mapping random forests. In this work, we develop an analog-digital architecture that implements a novel increased precision analog CAM and a programmable chip for inference of state-of-the-art tree-based ML models, such as XGBoost, CatBoost, and others. Thanks to hardware-aware training, X-TIME reaches state-of-the-art accuracy and 119x higher throughput at 9740x lower latency with >150x improved energy efficiency compared with a state-of-the-art GPU for models with up to 4096 trees and depth of 8, with a 19W peak power consumption.
연구 동기 및 목표
- 표본 데이터 기반의 대규모 트리 기반 기계학습 모델을 활용한 실시간 응용 분야에서 초저지연 추론의 증가하는 수요를 해결한다.
- 대규모 트리 앙상블에서 비정규적인 메모리 액세스와 스레드 동기화 문제로 인해 발생하는 CPU 및 GPU의 성능 저하 문제를 해결한다.
- 확장 가능하고 에너지 효율적인 추론을 위해 고정밀 아날로그 CAM과 재구성 가능한 片내 네트워크를 통합한 통합형 내장 아키텍처를 설계한다.
- 단일 칩에서 다양한 트리 기반 모델(예: 회귀, 다중 클래스 분류)과 추론 기법(예: 입력 배치 처리)을 지원할 수 있도록 한다.
- 메모리스트르의 도전성 변화 및 DAC 입력 오류와 같은 실제 하드웨어 변동성에 대응하기 위해 아키텍처적 내성과 오류 완화 기법을 제공한다.
제안 방법
- 결정 트리를 메모리스트르 기반의 CAM 셀에 저장된 아날로그 범위로 표현된 결정 임계값을 통해 아날로그 CAM 어레이에 매핑한다.
- 이전의 4비트 설계 대비 해상도와 정확도를 향상시키기 위해 새로운 8비트 정밀도 아날로그 CAM 셀 설계를 구현한다.
- 코어 내부의 SRAM을 사용해 리프 값 저장 및 단일 코어 내에서 다수의 트리에 걸쳐 국소 누적 연산을 수행한다.
- 4096개의 코어를 상호 연결하기 위해 재구성 가능한 H-트리 片내 네트워크(NoC)를 활용하여 확장 가능한 데이터 흐름과 모델 매핑을 가능하게 한다.
- 데이터가 NoC를 통해 전파되면서 리프 출력을 누적하는 네트워크 내 감소 논리를 통합하여 데이터 이동을 최소화한다.
- 결함 인식 설계 원칙을 적용하여, TaOx 메모리스트르와 16nm 아날로그 회로의 실험 데이터를 활용해 하드웨어 변동성으로 인한 정확도 저하를 모델링하고 완화한다.
실험 결과
연구 질문
- RQ18비트 정밀도를 갖춘 아날로그 CAM은 이전의 4비트 설계 대비 트리 기반 기계학습 추론의 정확도와 성능을 크게 향상시키는가?
- RQ2재구성 가능한 NoC와 내장형 컴퓨팅을 통합함으로써 다양한 트리 기반 모델 아키텍처에서 확장 가능하고 저지연 추론이 가능해지는가?
- RQ3메모리스트르 도전성 변화 및 DAC 입력 오류와 같은 실제 하드웨어 결함에 대해 제안된 아키텍처가 얼마나 내성적인가?
- RQ4대규모 트리 앙성스(예: 100만 개 이상의 노드)에 대해 최신 GPU 및 FPGA 가속기 대비 지연 시간과 처리량에서 어떤 성능 향상이 달성되는가?
- RQ5복잡한 모델과 다양한 추론 워크로드를 지원하면서도 높은 에너지 효율성(예: 낮은 결정당 에너지)을 유지할 수 있는가?
주요 결과
- X-TIME는 Churn 모델링 데이터셋에 대해 NVIDIA V100 GPU 대비 9740배 빠른 지연 시간과 119배 높은 처리량을 달성하며, 지연 시간은 약 100 ns에 이른다.
- 시스템은 트리 수나 리프 수에 관계없이 일정한 지연 시간과 처리량을 유지한다. 이는 GPU 및 FPGA와 달리 모델 크기에 따라 선형적으로 증가하는 것과 대비된다.
- 시스템은 최대 19W의 전력 소비만으로도 초저에너지 결정당 에너지 소비 0.3 nJ/결정을 달성하며, GPU 및 SRAM 기반 가속기 대비 뛰어난 성능을 보인다.
- 모델은 하드웨어 결함에 대해 내성적이다: 메모리스트르의 0.2% 확률의 전환 오류가 발생하더라도 정확도 저하가 0.5% 미만으로 유지되며, 이는 트리 기반 모델의 앙상블 특성 덕분이다.
- 8비트 아날로그 CAM 설계는 이전 연구 대비 정밀도를 두 배로 높여 정확도 향상에 기여하면서도 면적 및 전력 효율성에 손상을 주지 않는다.
- 재구성 가능한 NoC와 네트워크 내 감소 기능을 통해 입력 배치 처리 및 다중 클래스 분류와 같은 다양한 워크로드에 대해 효율적으로 대응하며, 데이터 이동을 최소화한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.