[논문 리뷰] COSIME: FeFET based Associative Memory for In-Memory Cosine Similarity Search
COSIME는 페로일렉트릭 FET(FeFET) 기반의 내장형 연관 메모리 아키텍처를 제안하여 효율적인 코사인 유사도 검색(CSS)을 실현한다. 전류 모드 아날로그 회로와 워너-테이크-all(WTA) 논리를 활용해 저장된 벡터들 간에 병렬로 저에너지 CSS를 수행한다. 약산된 CSS 설계 대비 333×의 지연 감소와 90.5×의 에너지 절감을 달성하였으며, HDC 추론에서 GPU 대비 47.1×의 속도 향상과 98.5×의 에너지 효율성 향상을 기록한다.
In a number of machine learning models, an input query is searched across the trained class vectors to find the closest feature class vector in cosine similarity metric. However, performing the cosine similarities between the vectors in Von-Neumann machines involves a large number of multiplications, Euclidean normalizations and division operations, thus incurring heavy hardware energy and latency overheads. Moreover, due to the memory wall problem that presents in the conventional architecture, frequent cosine similarity-based searches (CSSs) over the class vectors requires a lot of data movements, limiting the throughput and efficiency of the system. To overcome the aforementioned challenges, this paper introduces COSIME, an general in-memory associative memory (AM) engine based on the ferroelectric FET (FeFET) device for efficient CSS. By leveraging the one-transistor AND gate function of FeFET devices, current-based translinear analog circuit and winner-take-all (WTA) circuitry, COSIME can realize parallel in-memory CSS across all the entries in a memory block, and output the closest word to the input query in cosine similarity metric. Evaluation results at the array level suggest that the proposed COSIME design achieves 333X and 90.5X latency and energy improvements, respectively, and realizes better classification accuracy when compared with an AM design implementing approximated CSS. The proposed in-memory computing fabric is evaluated for an HDC problem, showcasing that COSIME can achieve on average 47.1X and 98.5X speedup and energy efficiency improvements compared with an GPU implementation.
연구 동기 및 목표
- 코사인 유사도 검색(CSS)의 높은 에너지 소비와 지연을 줄이기 위해, 베르누아르 아키텍처에서 발생하는 다수의 곱셈, 정규화 및 나눗셈 연산을 최소화하고자 한다.
- 기존 시스템의 메모리 월 문제를 해결하기 위해, 데이터 이동을 줄이기 위해 내장형 계산을 통해 메모리 내에서 연산을 수행하고자 한다.
- 기계학습 워크로드, 특히 초차원 컴퓨팅(HDC)과 DNN 추론에 적합한 일반적이고 에너지 효율적이며 정확도가 높은 CSS 가속기 설계를 목표로 한다.
- 완전 정밀도 소프트웨어 기반 CSS와 유사한 높은 정확도를 확보하면서도 하드웨어 효율성을 유지하고자 한다.
- 비버니시브 메모리(NVM) 기술을 활용해 확장 가능하고 내구성이 뛰어난 내장형 CSS를 실현하고자 하며, FeFET를 초과하는 다양한 NVM 기술로의 일반화를 보장하고자 한다.
제안 방법
- 입력 쿼리와 저장된 클래스 벡터 간의 행 단위 내적을 계산하기 위한 FeFET 어레이 두 개를 사용한다. 하나는 내적 계산을, 다른 하나는 L2 노름을 추정하기 위한 비트 수를 세는 데 사용된다.
- 제곱된 L2 노름을 계산하고 코사인 유사도에 필요한 나눗셈 연산을 수행하기 위해 전류 모드 전이선형 아날로그 회로를 활용한다.
- 입력 쿼리와 최대 코사인 유사도를 가지는 벡터를 동시에 병렬로 식별하기 위해 워너-테이크-all(WTA) 회로를 통합한다.
- FeFET의 한 트anz이스터 AND 게이트 기능을 활용해 비버니시브 저장 및 내장형 계산을 가능하게 한다.
- 주변 회로는 NVM 어레이와 독립적으로 설계되어, 출력 전류가 감지 범위 내에 있는 한 다른 NVM(예: ReRAM)과도 호환 가능하다.
- 디지털 산술 연산의 병목 현상을 피하기 위해 아날로그 계산을 활용하여 면적과 에너지 소비를 감소시킨다.
실험 결과
연구 질문
- RQ1FeFET 기반의 내장형 연관 메모리가 낮은 지연과 에너지 소비로 높은 정확도의 코사인 유사도 검색을 달성할 수 있는가?
- RQ2제안된 COSIME 아키텍처는 히프만 거리나 약산된 코사인 지표를 사용하는 기존의 근사 CSS 가속기와 비교해 성능와 정확도에서 어떤가?
- RQ3HDC 추론과 같은 메모리 기반 워크로드에서 COSIME는 데이터 이동을 얼마나 줄이고 처리량을 향상시키는가?
- RQ4실제 구현 환경에서 장치 변동성과 아날로그 회로 오차에 대해 COSIME는 얼마나 내구성이 있는가?
- RQ5COSIME 아키텍처는 FeFET를 초월한 다른 NVM 기술로 일반화될 수 있는가?
주요 결과
- COSIME는 동일한 FeFET 기술을 사용한 기존의 약산된 CSS 설계 대비 333×의 속도 향상과 90.5×의 에너지 절감을 달성한다.
- HDC 분류 작업에서 COSIME는 1,000차원 히퍼벡터를 사용할 때 NVIDIA 1080 GPU 대비 47.1× 높은 처리량과 98.5× 높은 에너지 효율성을 확보한다.
- 정확한 코사인 유사도 계산을 통해 히프만 거리 기반 방법보다 평균 7% 높은 분류 정확도를 유지한다.
- 장치 변동성에 대해 뛰어난 내구성을 보이며, HDC 분류는 AM에서 최대 10%의 오차율을 수용할 수 있으며, 이는 HDC의 내재된 오차 내성 범위 내에 있다.
- 주변 회로가 메모리 어레이 기술과 독립되어 있어, 접근 트anz이스터를 갖춘 다른 NVM 기술로도 일반화 가능하다.
- 더 높은 차원과 더 큰 클래스 수를 가진 데이터셋(예: 26개 클래스를 가진 ISOLET)은 COSIME에서 가장 큰 속도 향상과 에너지 효율성 향상을 경험한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.