[논문 리뷰] A Homogeneous Processing Fabric for Matrix-Vector Multiplication and Associative Search Using Ferroelectric Time-Domain Compute-in-Memory
이 논문은 단일 2FeFET 셀 설계를 사용하여 이진 행렬-벡터 곱셈(MAC)과 콘텐츠주소형메모리(CAM)를 모두 원천적으로 지원하는 동일한 페로일렉트릭 FET(FeFET) 타임도메인 컴퓨팅-인-메모리(TD-CiM) 어레이를 제안한다. 신호 전파 경로 외부에 FeFET를 위치시키고, 이를 통해 커패시터 로딩을 제어함으로써, 전체 디지털 호환성, 장치 변동성에 대한 강건성, 그리고 MAC 및 CAM 워크로드 간에 동적으로 세밀하게 재구성 가능한 설계를 달성하였다. 이로 인해 초고차원 컴퓨팅 워크로드에서 GPU 대비 63배의 성능 향상과 8563 TOPS/W의 에너지 효율성을 달성하였다.
In this work, we propose a ferroelectric FET(FeFET) time-domain compute-in-memory (TD-CiM) array as a homogeneous processing fabric for binary multiplication-accumulation (MAC) and content addressable memory (CAM). We demonstrate that: i) the XOR(XNOR)/AND logic function can be realized using a single cell composed of 2FeFETs connected in series; ii) a two-phase computation in an inverter chain with each stage featuring the XOR/AND cell to control the associated capacitor loading and the computation results of binary MAC and CAM are reflected in the chain output signal delay, illustrating full digital compatibility; iii) comprehensive theoretical and experimental validation of the proposed 2FeFET cell and inverter delay chains and their robustness against FeFET variation; iv) the homogeneous processing fabric is applied in hyperdimensional computing to show dynamic and fine-grain resource allocation to accommodate different tasks requiring varying demands over the binary MAC and CAM resources.
연구 동기 및 목표
- 기존의 타임도메인 컴퓨팅-인-메모리(TD-CiM) 어레이라는 FeFET가 신호 전파 경로에 포함되어 있어 장치 변동성에 민감하고 신호 차단 문제가 발생한다는 한계를 해결하기 위해.
- FeFET를 신호 전파 경로 외부로 이동시켜 커패시터 로딩을 제어함으로써 전체 디지털 호환성과 강건성을 확보하고자 하였다.
- 동일한 셀과 어레이 아키텍처를 사용하여 이진 MAC 및 CAM 연산을 원천적으로 지원하는 단일의 균일한 처리 기반을 설계하고자 하였다.
- 특히 초고차원 컴퓨팅(HDC) 응용 분야에서 워크로드 요구에 따라 동적으로 세밀하게 자원을 할당할 수 있도록 하여 MAC 및 CAM 간의 유연한 자원 할당을 실현하고자 하였다.
- 이론적 분석, 실험적 테스트 및 GPU 플랫폼과의 벤치마킹을 통해 제안된 FeFET TD-CiM 어레이라는 실현 가능하고 높은 성능을 보임을 검증하고자 하였다.
제안 방법
- FeFET를 직렬 연결된 비휘발성 메모리 상태를 활용하여 AND 및 XOR/XNOR 논리 기능을 동시에 수행할 수 있도록 2FeFET 셀을 설계하였다.
- FeFET는 인버터 체인의 로드 경로에 위치하여, 신호 전파 경로에 있지 않고 각 단계의 커패시턴스를 제어함으로써 신호 무결성과 디지털 호환성을 확보하였다.
- 이중 단계 계산 프로세스를 적용: 첫 번째 단계에서 입력 데이터에 따라 FeFET 상태를 설정하고, 두 번째 단계에서 인버터 체인을 통과하는 신호 전파 지연을 측정하여 계산 결과를 반영하였다.
- 인버터 체인의 지연은 이진 MAC(AND 논리 기반) 또는 CAM(XOR/XNOR 논리 기반)의 결과를 인코딩하는 데 사용되며, 출력 지연은 디지털 방식으로 감지된다.
- FeFET 상태를 재프로그래밍하여 MAC 및 CAM 모드 간에 동적으로 재구성 가능하게 하여 유연한 컴퓨팅 자원 할당이 가능해졌다.
- HDC 추론 워크로드의 에너지 및 지연을 모델링하기 위해 사이클 정확도를 갖춘 PyTorch 기반 시뮬레이터를 사용하여 제안된 TD-CiM 어레이에서 MAC 및 CAM 연산을 에뮬레이션하였다.
실험 결과
연구 질문
- RQ1동일한 셀과 아키텍처를 사용하여 FeFET 기반 TD-CiM 어레이는 이진 MAC 및 CAM 연산을 모두 원천적으로 지원할 수 있는가?
- RQ2FeFET를 신호 전파 경로 외부로 이동시켜 장치 변동성에 대한 강건성과 타임도메인 컴퓨팅에서의 디지털 호환성을 향상시킬 수 있는가?
- RQ3다양한 워크로드 요구에 따라 제안된 설계가 MAC 및 CAM 간에 얼마나 동적으로 그리고 세밀하게 자원을 할당할 수 있는가?
- RQ4초고차원 컴퓨팅과 같은 실제 워크로드에서 제안된 TD-CiM 어레이는 어떤 성능과 에너지 효율성을 보이는가?
- RQ5기존의 CiM 및 GPU 플랫폼에 비해 제안된 FeFET TD-CiM는 에너지 효율성, 속도, 재구성 가능성 측면에서 어떻게 비교되는가?
주요 결과
- 2FeFET 셀은 AND 및 XOR/XNOR 논리 기능을 성공적으로 구현하여 높은 신뢰성으로 단일 셀에서 이중 기능을 수행할 수 있었다.
- FeFET 기반 TD-CiM 어레이는 8563 TOPS/W의 에너지 효율성을 달성하여 이전의 연구 및 GPU 플랫폼을 크게 뛰어넘었다.
- 얼굴 인식, 활동 인식, 음성 인식 작업에서 GeForce RTX 3060 Ti GPU 대비 63배의 성능 향상과 106배의 에너지 절감을 보였다.
- FeFET의 변동성에 대해 강건한 설계를 구현하였으며, FeFET의 컨덕턴스 변동이 신호 경로에 영향을 주지 않도록 하기 위해 FeFET를 신호 경로 외부에 위치시킴으로써 신호 무결성이 유지되었다.
- 균일한 처리 기반은 HDC 워크로드의 특성에 맞게 MAC 및 CAM 모드 간에 동적으로 세밀하게 재구성 가능하게 하여 워크로드 요구에 유연하게 대응할 수 있었다.
- 제안된 솔루션은 단일 셀 유형을 사용하여 하나의 TD-CiM 어레이에서 재구성 가능하고 고효율의 MAC 및 CAM을 동시에 실현한 최초의 사례로, 전체 디지털 호환성과 낮은 외부 회로 복잡도를 확보하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.