[논문 리뷰] Near-Data Processing for Differentiable Machine Learning Models
이 논문은 다중 채널 SSD에서 스토리지 내 처리(in-storage processing, ISP)를 위한 전면적 시뮬레이터인 ISP-ML을 제안하여, 기계 학습 모델의 미분 가능 모델에서 확률적 경사 하강법(stochastic gradient descent, SGD)을 가속화하기 위한 근접 데이터 처리(near-data processing, NDP)를 평가한다. 이를 통해 데이터 이동을 줄이고 NAND 채널 간 병렬성을 활용함으로써 전통적인 호스트 내 처리(in-host processing, IHP)보다 ISP 기반 SGD가 성능을 뛰어올리며, 확장된 MNIST 데이터셋에 대한 동기화, Downpour, 탄력적 평균화 SGD 변형의 시뮬레이션을 통해 성능 향상이 검증됨.
Near-data processing (NDP) refers to augmenting memory or storage with processing power. Despite its potential for acceleration computing and reducing power requirements, only limited progress has been made in popularizing NDP for various reasons. Recently, two major changes have occurred that have ignited renewed interest and caused a resurgence of NDP. The first is the success of machine learning (ML), which often demands a great deal of computation for training, requiring frequent transfers of big data. The second is the popularity of NAND flash-based solid-state drives (SSDs) containing multicore processors that can accommodate extra computation for data processing. In this paper, we evaluate the potential of NDP for ML using a new SSD platform that allows us to simulate instorage processing (ISP) of ML workloads. Our platform (named ISP-ML) is a full-fledged simulator of a realistic multi-channel SSD that can execute various ML algorithms using data stored in the SSD. To conduct a thorough performance analysis and an in-depth comparison with alternative techniques, we focus on a specific algorithm: stochastic gradient descent (SGD), which is the de facto standard for training differentiable models such as logistic regression and neural networks. We implement and compare three SGD variants (synchronous, Downpour, and elastic averaging) using ISP-ML, exploiting the multiple NAND channels to parallelize SGD. In addition, we compare the performance of ISP and that of conventional in-host processing, revealing the advantages of ISP. Based on the advantages and limitations identified through our experiments, we further discuss directions for future research on ISP for accelerating ML.
연구 동기 및 목표
- 기계 학습 워크로드, 특히 확률적 경사 하강법(stochastic gradient descent, SGD)을 가속화하기 위해 SSD 내 처리 기능을 활용한 근접 데이터 처리(near-data processing, NDP)의 잠재력을 평가하기 위해.
- 다중 채널 SSD를 모의하는 현실적인 전체 시스템 수준의 시뮬레이터(ISP-ML)를 설계하고 구현하여 스토리지 내 처리 기능을 시뮬레이션할 수 있도록 하기 위해.
- 다양한 미분 가능 모델을 SGD 변형으로 학습할 때 스토리지 내 처리(in-storage processing, ISP)와 기존 호스트 내 처리(in-host processing, IHP) 간 성능을 비교하기 위해.
- ISP 기반 기계 학습 워크로드에서 성능 저하 요인과 향후 최적화 기회를 규명하기 위해.
- 고수준 및 저수준 기계 학습 작업을 하이브리드 방식으로 실행하기 위해 호스트와 SSD 간의 시스템 수준 협업을 탐색하기 위해.
제안 방법
- 일반 목적의 ARM 프로세서를 사용하여 스토리지 작업과 스토리지 내 처리 기능을 모두 지원하는 현실적인 다중 채널 NAND 플래시 SSD의 시스템 수준 시뮬레이터인 ISP-ML을 개발함.
- ISP-ML 프레임워크 내에서 SSD 채널 간 데이터 수준 병렬성을 활용하기 위해 동기화, Downpour, 탄력적 평균화 SGD의 세 가지 병렬 SGD 변형을 구현함.
- 기본 SSD의 I/O 시간을 시뮬레이션하기 위해 호스트 실행에서 추출한 I/O 트레이스를 사용함으로써, I/O 조건이 동일한 조건에서 ISP와 IHP 간의 공정한 상대적 성능 비교를 가능하게 함.
- 저장소 유형이 비-I/O 시간에 미치는 영향을 무시할 수 있을 정도로 낮다고 가정함으로써, ISP와 IHP 간의 I/O 및 처리 오버헤드 차이에 집중할 수 있음.
- 실제 데이터 접근 패턴을 유지하면서 더 큰 워크로드에서 성능을 평가하기 위해 MNIST 데이터셋의 10배 확장된 버전을 시뮬레이션함.
- ISP-ML 프레임워크 내에서 DRAM 버퍼, 캐시 컨트롤러, 채널 컨트롤러 간의 메모리 사용 분포를 분석하여 아키텍처적 트레이드오프를 탐색함.
실험 결과
연구 질문
- RQ1다중 채널 SSD에서 스토리지 내 처리(in-storage processing, ISP)가 다양한 기계 학습 모델, 특히 확률적 경사 하강법(stochastic gradient descent, SGD)을 사용하는 모델의 학습을 효과적으로 가속화할 수 있는가?
- RQ2실행 시간과 데이터 이동 감소 측면에서, ISP 기반 SGD는 기존 호스트 내 처리(in-host processing, IHP)에 비해 어떤 성능 차이를 보이는가?
- RQ3동기화, Downpour, 탄력적 평균화와 같은 다양한 병렬 SGD 변형이 ISP 환경에서 실행될 때 상대적인 장점과 한계는 무엇인가?
- RQ4고수준 및 저수준 기계 학습 작업을 하이브리드 방식으로 실행하기 위해 호스트와 SSD 간의 시스템 수준 협업은 어떻게 설계할 수 있는가?
- RQ5메타데이터 사전 계산, 데이터 재배치, 가변 페이지 크기와 같은 아키텍처 최적화 기법은 기계 학습 워크로드에 대한 ISP 성능 향상에 어떻게 기여할 수 있는가?
주요 결과
- ISP-ML은 현실적인 다중 채널 SSD를 성공적으로 시뮬레이션하여 기계 학습 워크로드에 대한 NDP 평가에 상세한 분석을 가능하게 함.
- 성능 비교 결과, ISP 기반 SGD는 호스트 내 처리 대비 데이터 이동 오버헤드를 크게 줄여 실행 시간 향상이 명백하게 나타남.
- 세 가지 SGD 변형 중에서 탄력적 평균화 SGD(elastic averaging SGD, EASGD)는 이방향 업데이트에 대한 강건성 덕분에 ISP 환경에서 우수한 수렴 특성과 성능 특성을 보였음.
- 시뮬레이션 결과, SSD 컨트롤러의 유휴 처리 능력을 특히 다수의 NAND 채널에 걸쳐 데이터가 분할된 경우 기계 학습 계산에 효과적으로 활용할 수 있음.
- 메모리 병목 현상과 NAND 페이지 크기를 초과하는 예제 크기로 인한 데이터 분할 현상과 같은 주요 과제를 규명하였으며, 이는 아키텍처 최적화의 필요성을 시사함.
- 향후 연구에서 IHP와 ISP를 결합하는 방식이 유망한데, 이는 호스트가 고수준 모델 로직을 담당하고 SSD가 저수준 데이터 의존 작업을 수행함으로써 전체 시스템 효율성을 향상시킬 수 있음.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.