[논문 리뷰] Towards Extremely Compact RNNs for Video Recognition with Fully Decomposed Hierarchical Tucker Structure
이 논문은 입력-은닉 및 은닉-은닉 가중치 행렬에 계층적 터서르 분해를 적용하는 새로운 RNN 아키텍처인 풀리 디컴포지드 히에라르키컬 터서르 리커런트 신경망(FDHT-LSTM)을 제안한다. 이는 극도로 낮은 파라미터 수로 모델 압축을 가능하게 한다. 이 방법은 비디오 인식 작업에서 기존 최고 성능 모델보다 최대 10,711배 이상 파라미터를 줄였으며, 최대 12.7% 높은 정확도를 달성하면서도 3,132~8,808개의 파라미터로만 구성된다.
Recurrent Neural Networks (RNNs) have been widely used in sequence analysis and modeling. However, when processing high-dimensional data, RNNs typically require very large model sizes, thereby bringing a series of deployment challenges. Although various prior works have been proposed to reduce the RNN model sizes, executing RNN models in resource-restricted environments is still a very challenging problem. In this paper, we propose to develop extremely compact RNN models with fully decomposed hierarchical Tucker (FDHT) structure. The HT decomposition does not only provide much higher storage cost reduction than the other tensor decomposition approaches but also brings better accuracy performance improvement for the compact RNN models. Meanwhile, unlike the existing tensor decomposition-based methods that can only decompose the input-to-hidden layer of RNNs, our proposed fully decomposition approach enables the comprehensive compression for the entire RNN models with maintaining very high accuracy. Our experimental results on several popular video recognition datasets show that our proposed fully decomposed hierarchical tucker-based LSTM (FDHT-LSTM) is extremely compact and highly efficient. To the best of our knowledge, FDHT-LSTM, for the first time, consistently achieves very high accuracy with only few thousand parameters (3,132 to 8,808) on different datasets. Compared with the state-of-the-art compressed RNN models, such as TT-LSTM, TR-LSTM and BT-LSTM, our FDHT-LSTM simultaneously enjoys both order-of-magnitude (3,985x to 10,711x) fewer parameters and significant accuracy improvement (0.6% to 12.7%).
연구 동기 및 목표
- 자원이 제한된 환경에서 대규모 RNN 모델을 구현하는 데 도전하는 것, 특히 고차원 비디오 데이터에 대해.
- 기존 터서르 분해 방법이 입력-은닉 레이어만 압축하고 은닉-은닉 가중치는 압축하지 못하는 한계를 극복하는 것.
- 극도로 낮은 파라미터 수를 달성하면서도 높은 정확도를 유지하는 압축 방법을 개발하는 것.
- 계층적 터서르 분해가 기존 터서르 분해 형식(TT, TR, BT 등)보다 압축 효율성과 정확도 유지 측면에서 뛰어나지 못할지 탐구하는 것.
제안 방법
- FDHT-LSTM 모델은 LSTM의 입력-은닉 및 은닉-은닉 가중치 행렬에 계층적 터서르(HT) 분해를 적용하여 전체 모델 압축을 가능하게 한다.
- 입력 및 출력 특징 벡터는 다차원 터서르 분해를 가능하게 하기 위해 4차원 텐서(예: 8×8×8×8)로 재형성된다.
- 모델 용량과 압축률을 제어하기 위해 잎 랭크는 UCF11의 경우 9, HMDB51의 경우 14로 설정하고, 비잎 랭크는 각각 6 또는 12로 설정한다.
- 잊기, 입력, 셀, 출력 게이트 가중치를 포함한 모든 순환 가중치 행렬에 분해를 적용하여 종단 간 압축을 보장한다.
- 사전 훈련된 Inception-V3를 피쳐 추출기로 사용하고, ADAM 옵timizer와 L2 정규화(0.0001), 드롭아웃(0.5)을 사용하여 모델을 훈련한다.
- 계층적 터서르 구조는 TT, TR, 또는 BT 분해보다 더 높은 저장소 비용 절감과 더 나은 정확도를 제공한다.
실험 결과
연구 질문
- RQ1RNN의 입력-은닉 및 은닉-은닉 가중치 행렬을 모두 분해함으로써 정확도 저하 없이 극도로 낮은 파라미터 수를 달성할 수 있는가?
- RQ2계층적 터서르 분해가 비디오 인식 작업에서 기존 터서르 분해 방법(TT, TR, BT 등)보다 압축 비율과 정확도 유지 측면에서 뛰어나지 못할까?
- RQ3비디오 인식 벤치마크에서 10,000개 이하의 파라미터로 압축된 RNN 모델이 높은 정확도를 유지할 수 있는가?
- RQ4제안된 FDHT-LSTM은 파라미터 수와 테스트 정확도 측면에서 TT-LSTM 및 TR-LSTM과 같은 최고 수준의 압축 RNN 모델과 비교해 어떻게 성능을 냈는가?
주요 결과
- UCF11 데이터셋에서 FDHT-LSTM은 총 2200만 개의 파라미터로 98.4%의 상위-1 정확도를 달성하여 TR-LSTM(93.8%)과 순수 LSTM(92.3%)을 앞서며 우수한 성능을 보였다.
- UCF11에서 FDHT-LSTM은 기준 LSTM 대비 최대 10,711배의 파라미터 감소를 이뤘으며, 기존 최고 성능 결과보다 3.8% 높은 정확도를 확보했다.
- HMDB51에서 FDHT-LSTM은 총 2200만 개의 파라미터로 64.2%의 정확도를 달성했으며, 이는 Two-Stream I3D(66.4%)의 성능을 따라가지만 훨씬 적은 파라미터를 사용했다.
- 동일한 사전 훈련된 CNN 피쳐 추출기를 사용함에도 불구하고, 두 데이터셋에서 FDHT-LSTM은 TR-LSTM 대비 모델 크기를 2.5배 줄였다.
- FDHT-LSTM은 UCF11에서 TR-LSTM 대비 12.7% 높은 정확도 향상을 보이며 극도의 압축 조건에서도 뛰어난 정확도 유지 능력을 입증했다.
- 저자들이 알고 있는 바에 따르면, FDHT-LSTM은 비디오 인식 작업에서 3,132~8,808개의 파라미터로만 구성되면서도 98% 이상의 높은 정확도를 달성한 최초의 RNN 모델이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.