[논문 리뷰] Towards Lower Bit Multiplication for Convolutional Neural Network Training.
이 논문은 CIFAR-10에 대해 2비트로, ImageNet에 대해 6비트로 컨볼루션 곱셈의 비트 폭을 줄이는 고정점 훈련 프레임워크를 제안한다. 이는 정확도 손실을 최소화하며, 제약 조건이 있는 그룹별 스케일링, 오버플로우와 반올림 오차를 균형 잡는 이동 가능한 고정점 형식, 더블 너비 배포 기법을 사용하여 훈련 시 에너지 소비를 최소 75% 감소시킨다.
Convolutional Neural Networks (CNNs) have been widely used in many fields. However, the training process costs much energy and time, in which the convolution operations consume the major part. In this paper, we propose a fixed-point training framework, in order to reduce the data bit-width for the convolution multiplications. Firstly, we propose two constrained group-wise scaling methods that can be implemented with low hardware cost. Secondly, to overcome the challenge of trading off overflow and rounding error, a shiftable fixed-point data format is used in this framework. Finally, we propose a double-width deployment technique to boost inference performance with the same bit-width hardware multiplier. The experimental results show that the input data of convolution in the training process can be quantized to 2-bit for CIFAR-10 dataset, 6-bit for ImageNet dataset, with negligible accuracy degradation. Furthermore, our fixed-point train-ing framework has the potential to save at least 75% energy of the computation in the training process.
연구 동기 및 목표
- CNN 컨볼루션 연산 중 입력 데이터의 비트 폭을 줄여 훈련의 에너지 효율성을 향상시키기.
- 저비트 고정점 표현에서 오버플로우와 양자화 반올림 오차 사이의 상충 관계를 해결하기.
- 기존의 저비트 폭 곱셈기와 호환되는 하드웨어 효율적인 고정점 훈련 프레임워크 설계하기.
- 동일한 비트 폭 하드웨어를 통해 높은 추론 성능을 달성하기 위해 더블 너비 배포 기법을 활용하기.
제안 방법
- 저비용 하드웨어를 위한 두 가지 제약 조건이 있는 그룹별 스케일링 방법을 도입한다.
- 오버플로우와 반올림 오차 사이의 상충 관계를 동적으로 관리하기 위해 이동 가능한 고정점 데이터 형식을 사용한다.
- 더 넓은 곱셈기 요구 사항 없이도 추론 속도를 향상시키기 위해 더블 너비 배포 기법을 적용한다.
- CIFAR-10과 ImageNet에 각각 2비트 및 6비트 입력을 사용하여 양자화 인식 훈련을 적용하여 모델 정확도를 유지한다.
- 표준 저비트 폭 곱셈기와 호환되도록 프레임워크를 설계하여 효율적인 하드웨어 배포를 가능하게 한다.
- 극한의 비트 폭 제약 조건 하에서도 정확도 저하를 최소화하기 위해 훈련 과정을 최적화한다.
실험 결과
연구 질문
- RQ1CIFAR-10에서 2비트 입력 정밀도로 컨볼루션 신경망 훈련을 수행할 수 있을까? 이 경우 정확도 손실이 크지 않은가?
- RQ2초저비트 폭 고정점 표현에서 오버플로우와 양자화 오차를 효과적으로 균형 잡을 수 있는가?
- RQ3실제 배포를 위해 고정점 훈련을 확장하기 위해 사용할 수 있는 하드웨어 효율적인 기법은 무엇인가?
- RQ4동일한 비트 폭 하드웨어 제약 조건 하에서 더블 너비 배포 기법이 추론 성능을 향상시킬 수 있는가?
- RQ5비트 폭 감소와 고정점 최적화를 통해 CNN 훈련의 에너지 소비를 어느 정도 줄일 수 있는가?
주요 결과
- 프레임워크는 CIFAR-10에 대해 2비트 입력 양자화를 수행하면서 정확도 저하가 거의 없이 가능하다.
- ImageNet의 경우 6비트 입력 정밀도로도 최소한의 정확도 손실로 훈련이 가능하다.
- 이동 가능한 고정점 형식은 오버플로우와 반올림 오차 사이의 상충 관계를 효과적으로 완화한다.
- 더블 너비 배포 기법은 더 넓은 곱셈기를 요구하지 않으며도 추론 성능을 향상시킨다.
- 제안된 프레임워크는 CNN 훈련 계산에서 최소 75%의 에너지 소비를 감소시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.