[논문 리뷰] Compressing Recurrent Neural Networks with Tensor Ring for Action Recognition
이 논문은 RNN의 입력-히든 가중치 행렬을 압축하기 위해 텐서 링 분해(Tensor Ring Decomposition, TRD)를 사용하는 컴act한 Long Short-Term Memory 네트워크인 TR-LSTM을 제안한다. 이는 높은 정확도를 유지하면서도 파라미터를 크게 감소시킨다. 이 방법은 UCF11에서 34,000 이상의 압축 비율을 달성하며, 종래의 LSTM, TT-LSTM, BT-LSTM보다 액션 인식에서 더 뛰어난 성능을 보였다. 종합적으로는 엔드 투 엔드 학습이 가능한 최신 기술 수준의 성능을 달성하였다.
Recurrent Neural Networks (RNNs) and their variants, such as Long-Short Term Memory (LSTM) networks, and Gated Recurrent Unit (GRU) networks, have achieved promising performance in sequential data modeling. The hidden layers in RNNs can be regarded as the memory units, which are helpful in storing information in sequential contexts. However, when dealing with high dimensional input data, such as video and text, the input-to-hidden linear transformation in RNNs brings high memory usage and huge computational cost. This makes the training of RNNs unscalable and difficult. To address this challenge, we propose a novel compact LSTM model, named as TR-LSTM, by utilizing the low-rank tensor ring decomposition (TRD) to reformulate the input-to-hidden transformation. Compared with other tensor decomposition methods, TR-LSTM is more stable. In addition, TR-LSTM can complete an end-to-end training and also provide a fundamental building block for RNNs in handling large input data. Experiments on real-world action recognition datasets have demonstrated the promising performance of the proposed TR-LSTM compared with the tensor train LSTM and other state-of-the-art competitors.
연구 동기 및 목표
- 고차원 비디오 데이터를 처리할 때 RNN의 입력-히든 변환에 대한 높은 파라미터 수와 계산 비용을 해결하기 위해.
- 텐서 트레인 분해(TTD)의 한계, 즉 엄격한 랭크 제약과 코어 순서에 대한 민감성을 해결하기 위해.
- 성능을 유지하면서 모델 크기를 극적으로 줄이는 안정적인 저랭크 RNN 아키텍처를 개발하기 위해.
- 다양분산 가능한 텐서 링 레이어를 플러그인 빌딩 블록으로 사용하여 압축된 RNN의 엔드 투 엔드 학습을 가능하게 하기 위해.
- 실세계 액션 인식 벤치마크에서 최신 기술 수준의 저랭크 RNN 방법들과 비교하여 뛰어난 압축 비율과 정확도를 입증하기 위해.
제안 방법
- 표준 LSTM의 입력-히든 가중치 행렬을 고차원 텐서로 재구성하고, 텐서 링 분해(TRD)를 사용하여 인수분해한다.
- TRD는 가중치 텐서를 저랭크 코어 텐서의 순환 체인으로 분해하여 효율적인 파라미터 공유와 상호 파라미터 상관관계 모델링을 가능하게 한다.
- TR 레이어는 미분 가능하며 LSTM 계산 그래프에 원활하게 통합되어 엔드 투 엔드 역전파를 허용한다.
- 첫 번째 및 마지막 코어 텐서 간의 순환 연결을 사용함으로써, 텐서 트레인 분해의 엄격한 랭크 제약을 완화한다.
- 초기화된 하이퍼파라미터(예: TR-랭크)를 성능과 압축 비율 최적화를 위해 조정하면서, 비디오 액션 인식 데이터셋에서 엔드 투 엔드로 학습한다.
- 이 방법은 일반화 가능하며, 단순한 RNN과 GRU에도 적용 가능하며, LSTM 외부로도 확장 가능하다.
실험 결과
연구 질문
- RQ1텐서 링 분해가 RNN의 입력-히든 가중치 행렬을 효과적으로 압축하면서도 모델 성능을 유지할 수 있는가?
- RQ2액션 인식 작업에서 TR-LSTM은 TT-LSTM 및 BT-LSTM과 비교해 압축 비율과 정확도 측면에서 어떻게 다른가?
- RQ3극도로 파라미터가 압축된 상황에서도 TR-LSTM 모델은 안정성과 일반화 능력을 유지하는가?
- RQ4TR 레이어는 성능 저하 없이 RNN의 엔드 투 엔드 학습에 효과적으로 사용될 수 있는가?
- RQ5TR-LSTM 아키텍처는 기존의 LSTM 기반 모델에 대한 플러그인 모듈로 적합한가?
주요 결과
- TR-LSTM는 UCF11 데이터셋에서 표준 LSTM 대비 34,000 이상의 압축 비율을 달성했으며, TT-LSTM 및 BT-LSTM보다 뚜렷이 뛰어난 성능을 보였다.
- UCF11에서 TR-LSTM는 엔드 투 엔드 학습으로 86.9%의 정확도를 달성했으며, 표준 LSTM(68.1%), TT-LSTM(80.3%), BT-LSTM(85.6%)를 모두 초월했다.
- InceptionV3의 특징을 입력으로 사용할 경우, TR-LSTM는 단지 0.7M의 파라미터로 63.8%의 정확도를 달성했으며, I3D의 25M 파라미터보다도 뛰어난 성능을 보였다.
- TRD의 순환 코어 구조의 강건성 덕분에, 극도로 압축된 상황에서도 높은 안정성과 일반화 능력을 유지했다.
- TR 레이어는 뛰어난 표현력과 유연성을 보였으며, 파라미터 수가 더 적은 상황에서도 TT-LSTM보다 더 뛰어난 성능을 내었다.
- 이 방법은 확장 가능하며, 두 개의 스트림 LSTM과 같은 고급 RNN 아키텍처에 기본 빌딩 블록으로 통합될 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.