[논문 리뷰] Compression of Fully-Connected Layer in Neural Network by Kronecker Product
이 논문은 신경망의 완전연결층의 가중치 행렬을 더 작은 행렬의 크로네커 곱의 선형 조합으로 근사함으로써 완전연결층을 압축하는 크로네커 완전연결(Kronecker Fully-Connected, KFC) 레이어를 제안한다. 이로 인해 파라미터 수를 최대 99% 감소시키고 계산 시간도 크게 줄일 수 있으며, 정확도는 유지된다. 특히 SVHN에서 73%의 파라미터 감소를 달성했고, 오차 증가 폭은 낮아서 저질 랭크 방법 대비 35%의 감소에 비해 유의미하게 뛰어나다.
In this paper we propose and study a technique to reduce the number of parameters and computation time in fully-connected layers of neural networks using Kronecker product, at a mild cost of the prediction quality. The technique proceeds by replacing Fully-Connected layers with so-called Kronecker Fully-Connected layers, where the weight matrices of the FC layers are approximated by linear combinations of multiple Kronecker products of smaller matrices. In particular, given a model trained on SVHN dataset, we are able to construct a new KFC model with 73\% reduction in total number of parameters, while the error only rises mildly. In contrast, using low-rank method can only achieve 35\% reduction in total number of parameters given similar quality degradation allowance. If we only compare the KFC layer with its counterpart fully-connected layer, the reduction in the number of parameters exceeds 99\%. The amount of computation is also reduced as we replace matrix product of the large matrices in FC layers with matrix products of a few smaller matrices in KFC layers. Further experiments on MNIST, SVHN and some Chinese Character recognition models also demonstrate effectiveness of our technique.
연구 동기 및 목표
- 신경망의 완전연결층에서 파라미터 수와 계산 시간을 현저히 줄이되 정확도 저하를 최소화하는 것.
- 엄격한 자원 제약 조건 하에서도 모델 성능을 유지하는 구조적 파라미터 압축 기법을 탐색하는 것.
- 신경망 레이어에서 크로네커 곱 기반 압축 기법과 기존의 저랭크 근사 방법 간의 효과성을 비교하는 것.
- MNIST, SVHN, 중국어 문자 인식 작업 등 다양한 데이터셋에서 제안된 방법의 성능을 평가하는 것.
- 크로네커 기반 압축 기법이 컨볼루션 레이어나 RNN과 같은 다른 아키텍처로 확장 가능한지 조사하는 것.
제안 방법
- 완전연결 레이어의 가중치 행렬을 더 작은 행렬의 크로네커 곱의 선형 조합으로 근사하여 효율적인 파arameter화를 가능하게 한다.
- 텐서 입력을 위한 KFC-I와 행렬 입력을 위한 KFC-M이라는 두 가지 제작 방식을 사용하며, 모두 크로네커 곱 분해 기반이다.
- 크로네커 곱 분해를 적용하여 큰 가중치 행렬을 저장 및 계산 비용이 낮은 작은 행렬의 조합으로 표현함으로써 저장 공간과 계산 시간을 절감한다.
- 새로운 KFC 레이어 파라미터가 입력 데이터에 적응하도록 미세조정(fine-tuning)을 통해 훈련하여 근사 후 일반화 성능을 향상시킨다.
- 랭크 r인 행렬은 두 개의 더 작은 행렬의 곱으로 표현될 수 있다는 구조적 제약 조건을 활용하여 크로네커 분해를 통한 저랭크 근사가 가능하다.
- 다양한 크로네커 곱 분해 방식(형식 II, III, IV)을 조합함으로써 표현 능력을 높이면서도 압축률을 유지한다.
실험 결과
연구 질문
- RQ1크로네커 곱 기반 분해가 신경망의 완전연결층을 효과적으로 압축하면서도 모델 정확도를 유지할 수 있는가?
- RQ2기본 데이터셋에서 KFC 레이어의 파라미터 감소율과 정확도 간 트레이드오프는 저랭크 근사 방법보다 어떻게 다를까?
- RQ3실제 응용 분야인 이미지 및 문자 인식에서 KFC 레이어는 계산량과 모델 크기를 얼마나 줄일 수 있는가?
- RQ4여러 개의 크로네커 곱 제작 방식을 조합하면 압축률을 유지하면서도 모델 성능을 향상시킬 수 있는가?
- RQ5크로네커 곱 기법은 컨볼루션 레이어나 순환 레이어와 같은 다른 레이어로 확장 가능할 수 있는가? 이를 통해 더 넓은 범위의 신경망 압축이 가능할까?
주요 결과
- SVHN 데이터셋에서 KFC-II 방법은 기준 모델 대비 완전연결층 파라미터를 99.0% 감소시켰고, 테스트 오차는 0.76% 증가에 그쳤다.
- KFC-Combined 방법은 총 모델 파라미터를 73.7% 감소시켰고, 테스트 오차는 2.60%를 기록하여, 55.1%의 파라미터 감소로 3.67% 오차를 기록한 LowRank-64를 능가했다.
- 중국어 문자 인식 작업에서 KFC-KFCM-rank-10 방법은 총 파라미터 수를 91.8% 감소시켰고, 테스트 오차는 13.0%를 기록하여 랭크 1에서 발생한 성능 손실의 대부분을 복구했다.
- KFC 레이어는 원래 완전연결층 대비 파라미터 수를 99% 이상 감소시켜 뛰어난 압축 효율성을 입증했다.
- KFC 방법은 SVHN에서 최대 73%의 총 파라미터 감소를 달성했고, 정확도 손실은 최소한이었으며, 저랭크 방법 대비 유의미하게 뛰어나 35%의 감소에 그친다.
- KFC 레이어 구축 후의 미세조정이 정확도 저하를 효과적으로 완화시켜, 실제 적용 가능성에 대한 메서드의 타당성을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.