[논문 리뷰] Rethinking Floating Point Overheads for Mixed Precision DNN Accelerators
이 논문은 저해상도 정수 연산의 시간적 분해를 활용하여 하드웨어 오버헤드를 최소화하면서도 FP16 산술 연산을 효율적으로 지원하는 혼합 정밀도 컨볼루션 유닛을 제안한다. 실제로는 최대 8비트의 지수 차이가 발생하는 것으로 관찰됨에 따라, 정렬 논리의 복잡도를 감소시켜 기존 설계 대비 최대 46% 높은 TOPS/mm² 및 63% 향상된 TOPS/W 효율성을 달성한다.
In this paper, we propose a mixed-precision convolution unit architecture which supports different integer and floating point (FP) precisions. The proposed architecture is based on low-bit inner product units and realizes higher precision based on temporal decomposition. We illustrate how to integrate FP computations on integer-based architecture and evaluate overheads incurred by FP arithmetic support. We argue that alignment and addition overhead for FP inner product can be significant since the maximum exponent difference could be up to 58 bits, which results into a large alignment logic. To address this issue, we illustrate empirically that no more than 26-bitproduct bits are required and up to 8-bit of alignment is sufficient in most inference cases. We present novel optimizations based on the above observations to reduce the FP arithmetic hardware overheads. Our empirical results, based on simulation and hardware implementation, show significant reduction in FP16 overhead. Over typical mixed precision implementation, the proposed architecture achieves area improvements of up to 25% in TFLOPS/mm2and up to 46% in TOPS/mm2with power efficiency improvements of up to 40% in TFLOPS/Wand up to 63% in TOPS/W.
연구 동기 및 목표
- 저정밀도 정수 기반 DNN 가속기에서 FP16 산술 연산을 지원하기 위한 높은 하드웨어 오버헤드 문제를 해결하기 위해.
- 실세계 DNN 추론 워크로드에서 지수 차이의 실제 동적 범위를 규명하기 위해.
- 정확도를 훼손하지 않으면서도 FP16 내적 곱셈 유닛의 정렬 및 덧셈 논리 오버헤드를 최소화하기 위해.
- INT4 최적화 아키텍처에서 FP16 지원 비용을 감소시켜 효율적인 혼합 정밀도 추론을 가능하게 하기 위해.
- 선택적 FP16 사용을 통해 FP32 수준의 정확도를 유지하면서도 면적 및 전력 효율성을 향상시키기 위해.
제안 방법
- 낮은 비트 수(예: INT4) 내적 곱셈 유닛을 기반으로 하여 시간적 분해를 통해 고정밀도 연산을 지원하는 컨볼루션 유닛 설계.
- 시간에 따라 더 높은 정밀도 연산을 모방하기 위해 4비트 세밀도 연산을 기본 단위로 사용.
- 실제 DNN 워크로드를 분석하여 지수 차이의 최대치가 흔히 8비트를 초과하지 않는다는 점을 관찰하고, 이를 바탕으로 축소된 폭의 정렬 유닛을 구현.
- 이론적으로 가능한 58비트 최대치가 아닌 관측된 8비트 정렬 범위에 맞춰 애더 트리 정밀도를 최적화.
- 기존 저정밀도 곱셈기 및 누적기 논리를 재사용하여 정수 기반 아키텍처에 FP16 지원을 최소한의 면적 및 전력 오버헤드로 통합.
- 시뮬레이션 및 하드웨어 구현을 통해 면적, 전력, 성능 향상도를 측정하여 설계를 검증.
실험 결과
연구 질문
- RQ1일반적인 DNN 추론 워크로드에서 FP16 곱셈 결과 간 실제 지수 차이의 동적 범위는 무엇인가?
- RQ2실제로 FP16 내적 곱셈 연산을 수행할 때 필요한 정렬 논리는 얼마나 필요한가?
- RQ3저정밀도 정수 기반 DNN 가속기에서 과도한 면적 및 전력 오버헤드 없이도 FP16 산술 연산을 효율적으로 지원할 수 있는가?
- RQ4시간적 분해를 통해 혼합 정밀도 연산의 하드웨어 비용을 얼마나 줄일 수 있는가?
- RQ5INT4 최적화 아키텍처에서 FP16 지원 논리 최소화 시 성능 및 효율성 향상은 어느 정도인가?
주요 결과
- 실제 DNN 워크로드에서 FP16 곱셈 결과 간 최대 지수 차이는 이론적으로 가능한 58비트 최대치와는 달리 일반적으로 8비트 이하이다.
- FP16 연산을 위해 최대 26비트의 곱셈 비트만 필요하며, 이는 중간 계산의 정밀도를 낮출 수 있음을 의미한다.
- 제안된 아키텍처는 FP16 정렬 논리를 8비트 시프트 유닛으로 줄여 면적 및 전력 오버헤드를 크게 감소시켰다.
- 기존 표준 혼합 정밀도 구현 대비 최대 25% 향상된 TFLOPS/mm² 및 최대 46% 향상된 TOPS/mm² 성능을 달성했다.
- TFLOPS/W 기준 최대 40% 향상된 전력 효율성 및 TOPS/W 기준 최대 63% 향상된 전력 효율성으로 강력한 에너지 절감 효과를 입증했다.
- 최적화는 분해 기법과 상호 독립적이며 시간적 및 공간적 융합 접근 방식 모두에 적용 가능하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.