Skip to main content
QUICK REVIEW

[논문 리뷰] Rethinking Full Connectivity in Recurrent Neural Networks

Matthijs Van Keirsbilck, Alexander Keller|arXiv (Cornell University)|2019. 05. 29.
Advanced Neural Network Applications참고 문헌 39인용 수 14
한 줄 요약

이 논문은 전체 연결성을 대체하기 위해 국소적 또는 자기 연결을 갖춘 구조적으로 희소한 순환 신경망—특히 DiagonalRNN와 BandRNN—을 제안한다. 순환 가중치 행렬을 희소하고 하드웨어 우수한 구조로 줄임으로써 메모리와 계산량을 수십~수백 배 감소시키면서도 언어 모델링, 음성 인식, 비디오 동작 인식 작업에서 경쟁 가능한 성능을 유지한다.

ABSTRACT

Recurrent neural networks (RNNs) are omnipresent in sequence modeling tasks. Practical models usually consist of several layers of hundreds or thousands of neurons which are fully connected. This places a heavy computational and memory burden on hardware, restricting adoption in practical low-cost and low-power devices. Compared to fully convolutional models, the costly sequential operation of RNNs severely hinders performance on parallel hardware. This paper challenges the convention of full connectivity in RNNs. We study structurally sparse RNNs, showing that they are well suited for acceleration on parallel hardware, with a greatly reduced cost of the recurrent operations as well as orders of magnitude less recurrent weights. Extensive experiments on challenging tasks ranging from language modeling and speech recognition to video action recognition reveal that structurally sparse RNNs achieve competitive performance as compared to fully-connected networks. This allows for using large sparse RNNs for a wide range of real-world tasks that previously were too costly with fully connected networks.

연구 동기 및 목표

  • 특히 저전력 및 저비용 장치에서 전체 연결 RNN의 높은 계산 및 메모리 비용을 해결하기 위해.
  • 현대 하드웨어에서 병렬 처리를 제한하는 RNN의 순차적 병목 현상을 극복하기 위해.
  • 구조적으로 희소한 RNN이 전체 연결 RNN과 경쟁하거나 뛰어넘는 성능을 달성하면서도 파라미터 수와 추론 비용을 극적으로 줄일 수 있는지 탐구하기 위해.
  • 밀도 있는 순환 연결을 희소하고 국소적이거나 자기 연결로 대체할 때 발생하는 아키텍처적 및 하드웨어적 영향을 조사하기 위해.
  • 모델 용량을 손상시키지 않은 채 구조적 희소성을 활용하여 고정된 하드웨어 예산 내에서 더 큰 네트워크 크기를 가능하게 하기 위해.

제안 방법

  • 각 뉴런이 대각선 순환 가중치 행렬을 통해 자신에게만 연결되는 DiagonalRNN을 도입하여 순환 계산을 O(n²)에서 O(n)으로 감소시킨다.
  • 각 뉴런이 자신과 고정된 수의 인접 뉴런(C)에만 연결되는 국소 연결 변형인 BandRNN을 제안하여 띠 모양의 가중치 행렬을 형성한다.
  • GPU 및 TPU 가속화에 적합한 규칙적인 메모리 액세스 패턴을 보장하기 위해 구조적 희소성(비구조적 프루닝이 아님)을 사용한다.
  • 언어 모델링(LibriTTS), 음성 인식(VCTK), 비디오 동작 인식(UCF101)과 같은 표준 벤치마크에서 희소 RNN을 훈련하고 평가한다.
  • 테스트 CER, 정확도, 순환 가중치 수를 측정하여 전체 연결 GRU 및 LSTM과 성능와 효율성을 비교한다.
  • 기존 아키텍처인 PreRNN과의 통합을 통해 엔드 투 엔드 모델에서의 호환성과 성능 향상을 평가한다.

실험 결과

연구 질문

  • RQ1국소적 또는 자기 연결을 갖춘 구조적으로 희소한 RNN이 순차 모델링 작업에서 전체 연결 RNN과 유사한 성능를 달성할 수 있는가?
  • RQ2구조적 희소성이 얼마나 많은 순환 가중치 수와 계산 비용을 줄일 수 있으며, 모델 정확도를 유지할 수 있는가?
  • RQ3고정된 하드웨어 예산 하에서 네트워크 크기가 증가함에 따라 희소 RNN의 성능가 전체 연결 모델 대비 어떻게 변화하는가?
  • RQ4희소 RNN이 동일한 메모리 및 계산 제약 조건 내에서 더 큰 네트워크 아키텍처를 가능하게 하여 성능 향상을 이끌 수 있는가?
  • RQ5구조적 희소성의 사용이 비구조적 희소성 또는 밀도 있는 RNN보다 더 나은 하드웨어 병렬 처리와 성능 향상을 이끌 수 있는가?

주요 결과

  • DiagonalRNN와 BandRNN는 LibriTTS와 VCTK에서 전체 연결 GRU와 경쟁 가능한 성능를 보이며, 각각 8.57%와 9.69%의 테스트 CER를 기록했고, 순환 가중치를 최대 100배까지 감소시켰다.
  • UCF101 비디오 동작 인식에서 DiagonalRNN와 BandRNN는 92.5~93.5%의 정확도를 달성했으며, 순환 가중치 수가 2.19×10⁵에서 4.98×10⁶으로, 전체 PreRNN 대비 최대 100배 적게 사용했다.
  • 더 큰 희소 네트워크(예: DiagonalGRU의 1100개 유닛)는 동일한 파라미터 예산 하에서 더 작은 전체 연결 모델(예: Full GRU의 768개 유닛)보다 뛰어난 성능를 보였다.
  • 구조적 희소성의 사용은 효율적인 병렬 처리를 가능하게 하여 밀도 있는 RNN에 내재된 순차적 병목 현상을 제거하고 하드웨어 활용도를 향상시켰다.
  • C=201인 BandRNN은 UCF101에서 93.2%의 정확도를 달성했고, 순환 가중치 수가 4.98×10⁶에 불과했으며, 전체 PreRNN의 성능를 유지하면서도 순환 가중치 수를 약 80% 감소시켰다.
  • DiagonalRNN와 PreRNN-SIH의 조합은 순환 가중치 수가 단지 2.19×10⁵에 불과한 92.6%의 정확도를 기록했으며, 전체 PreRNN 대비 100배 이상 적은 가중치를 사용했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.