Skip to main content
QUICK REVIEW

[논문 리뷰] Sigma Delta Quantized Networks

Peter O’Connor, Max Welling|arXiv (Cornell University)|2016. 11. 07.
Advanced Neural Network Applications참고 문헌 12인용 수 11
한 줄 요약

이 논문은 깊이 학습에서 계산 비용을 줄이기 위해 각 레이어 간에 전체 활성화 값 대신 뉘앙스의 이산적 변화만 전송하는 방법인 시그마-델타 양자화 네트워크를 소개한다. 시간적 차이를 반올림하고 정확도와 계산 간의 상충 관계를 최적화함으로써, 이 방법은 비디오 데이터에서 계산을 최대 10배까지 줄일 수 있으며 높은 분류 정확도를 유지한다.

ABSTRACT

Deep neural networks can be obscenely wasteful. When processing video, a convolutional network expends a fixed amount of computation for each frame with no regard to the similarity between neighbouring frames. As a result, it ends up repeatedly doing very similar computations. To put an end to such waste, we introduce Sigma-Delta networks. With each new input, each layer in this network sends a discretized form of its change in activation to the next layer. Thus the amount of computation that the network does scales with the amount of change in the input and layer activations, rather than the size of the network. We introduce an optimization method for converting any pre-trained deep network into an optimally efficient Sigma-Delta network, and show that our algorithm, if run on the appropriate hardware, could cut at least an order of magnitude from the computational cost of processing video data.

연구 동기 및 목표

  • 입력 프레임 간 유사성이 상관없이 매번 고정된 계산을 수행하는 표준 딥 네트워크의 비효율성을 해결하기 위해.
  • 비디오 데이터의 시간적 중복성을 활용하여 네트워크 크기 대신 입력 변화에 따라 계산을 조절하는 네트워크를 설계하기 위해.
  • 사전 훈련된 네트워크를 정확도 저하를 최소한으로 하여 계산적으로 효율적인 시그마-델타 네트워크로 변환하는 방법을 개발하기 위해.
  • 분산 또는 센서 기반 신경망에서 비동기적 업데이트를 효율적으로 가능하게 하기 위해 계산을 입력 변화에 비례하도록 만들기 위해.

제안 방법

  • 사전 훈련된 딥 네트워크를 수정하여 전체 정밀도 활성화 전파를 연속적인 입력 간 활성화의 시간적 차이의 이산 양자화로 대체한다.
  • 시간 단위 간 활성화의 차이에 대한 반올림 연산을 도입하여 레이어 간 희박하고 저정밀도의 통신을 가능하게 한다.
  • 각 레이어별 스케일 파라미터를 적용하여 계산 비용과 네트워크 정확도 사이의 상충 관계를 균형 잡는다.
  • 재구성 오차와 계산 비용을 균형 잡는 미분 가능한 목적 함수를 사용하여 스케일 파라미터를 네트워크 가중치와 함께 공동 최적화한다.
  • 최적화를 안정화하고 반올림으로 인한 활성화 붕괴를 방지하기 위해 훈련 중에 균일한 랜덤 노이즈를 적용한다.
  • 사전 훈련된 VGG-16 네트워크를 시그마-델타 네트워크로 변환하여 기능을 유지하면서 계산을 줄인다.

실험 결과

연구 질문

  • RQ1오직 양자화된 활성화 차이만 전송함으로써 깊이 학습 네트워크를 입력 변화에 비례하는 계산 적응형으로 만들 수 있는가?
  • RQ2정확도 손실를 최소한으로 하여 사전 훈련된 네트워크를 효율적으로 시그마-델타 네트워크로 변환할 수 있는가?
  • RQ3이러한 시스템에서 계산 비용과 정확도 사이의 상충 관계는 어떠한가? 그리고 이를 어떻게 최적화할 수 있는가?
  • RQ4이 방법은 정확도를 희생시키지 않고도 시간적 중복성이 높은 데이터인 비디오에서 계산을 크게 줄일 수 있는가?
  • RQ5전체 활성화 값 대신 이산적 변화만 사용함에도 불구하고 네트워크가 기능을 유지하는 이유는 무엇인가?

주요 결과

  • 정적 비디오 세그먼트에서 움직임이 거의 없는 동안 시그마-델타 네트워크는 원래 VGG-16 네트워크보다 약 11배 적은 계산을 수행한다.
  • 더 동적인 비디오 세그먼트에서는 네트워크가 원래 네트워크 대비 약 4배의 계산을 줄인다.
  • 이 방법을 통해 비디오 데이터에서 계산 비용을 최대 10배까지 줄일 수 있으며, ILSVRC 2015 데이터셋에서 이를 입증하였다.
  • 네트워크는 높은 분류 정확도를 유지한다: 거의 모든 프레임에서 시그마-델타 네트워크의 예측은 원래 VGG-16 네트워크의 상위 5개 예측 중 하나이다.
  • 시간 t의 출력은 과거 네트워크 상태에 의존하지 않고 현재 입력에만 의존한다. 비록 네트워크 내부 상태가 과거에 의존하더라도 말이다.
  • 훈련 중에 균일한 랜덤 노이즈를 추가함으로써 최적화가 안정화되고 반올림으로 인한 활성화 값이 0으로 붕괴되는 것을 방지할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.