Skip to main content
QUICK REVIEW

[논문 리뷰] Self-Delimiting Neural Networks

Juergen Schmidhuber|arXiv (Cornell University)|2012. 09. 29.
Advanced Memory and Neural Computing인용 수 22
한 줄 요약

이 논문은 프로그램을 가중치 행렬로 인코딩하고 전용 정지 뉴런을 통해 자가 종료하는 새로운 유형의 순환 신경망인 Self-Delimiting Neural Networks(SLIM NNs)를 소개한다. 실행 중 활성화된 뉴런과 연결만을 추적함으로써 SLIM NNs는 효율적인 리셋과 학습을 가능하게 하며, 동적 매개변수 선택을 통해 과적합을 감소시키고, AOPS를 통한 점근적으로 최적의 학습을 지원함으로써 확장 가능하고, 과제에 특화되며 물리적으로 효율적인 신경계산을 실현한다.

ABSTRACT

Self-delimiting (SLIM) programs are a central concept of theoretical computer science, particularly algorithmic information & probability theory, and asymptotically optimal program search (AOPS). To apply AOPS to (possibly recurrent) neural networks (NNs), I introduce SLIM NNs. Neurons of a typical SLIM NN have threshold activation functions. During a computational episode, activations are spreading from input neurons through the SLIM NN until the computation activates a special halt neuron. Weights of the NN's used connections define its program. Halting programs form a prefix code. The reset of the initial NN state does not cost more than the latest program execution. Since prefixes of SLIM programs influence their suffixes (weight changes occurring early in an episode influence which weights are considered later), SLIM NN learning algorithms (LAs) should execute weight changes online during activation spreading. This can be achieved by applying AOPS to growing SLIM NNs. To efficiently teach a SLIM NN to solve many tasks, such as correctly classifying many different patterns, or solving many different robot control tasks, each connection keeps a list of tasks it is used for. The lists may be efficiently updated during training. To evaluate the overall effect of currently tested weight changes, a SLIM NN LA needs to re-test performance only on the efficiently computable union of tasks potentially affected by the current weight changes. Future SLIM NNs will be implemented on 3-dimensional brain-like multi-processor hardware. Their LAs will minimize task-specific total wire length of used connections, to encourage efficient solutions of subtasks by subsets of neurons that are physically close. The novel class of SLIM NN LAs is currently being probed in ongoing experiments to be reported in separate papers.

연구 동기 및 목표

  • 순환 신경망(RNNs)에 대해 점근적으로 최적의 프로그램 탐색(AOPS)을 적용할 수 있는 방법이 부족한 문제를 해결하기 위해 자기 종료형 프레임워크를 도입한다.
  • 각 계산 에피소드에서 실제로 사용된 부분만 추적함으로써, 희소하게 사용되는 대규모 신경망에서 효율적인 훈련과 추론을 가능하게 한다.
  • 과제 요구에 따라 효과적인 네트워크 크기를 동적으로 선택함으로써 과적합 방지를 위한 내장된 메커니즘을 제공한다.
  • 과제별 가중치 사용을 추적하고 계산 오버헤드를 최소화함으로써 일반 문제 해결자에서 효율적이고 확장 가능한 학습을 지원한다.
  • 미래의 3차원 뇌 유사 하드웨어와 호환되는 학습 프레임워크를 설계함으로써, 과제별 하위네트워크를 물리적으로 국소화하는 데 기여한다.

제안 방법

  • 프로그램이 가중치 행렬에 인코딩되고 계산이 전용 정지 뉴런을 통해 중단되는 일반 목적의 컴퓨터로 SLIM NNs를 제안하며, 자가 종료 실행을 보장한다.
  • 계산 에피소드 동안 실제로 사용된 뉴런과 연결만을 추적함으로써, 상태를 효율적으로 리셋하고 네트워크의 활성 부분에 한정된 계산 비용을 낮춘다.
  • 정지 프로그램에 프리픽스 코드 구조를 적용하여, 학습 및 평가 시 오직 활성 하위네트워크만을 고려함으로써 안정성을 확보한다.
  • 활성화 전파 중에 일괄적으로 점근적으로 최적의 프로그램 탐색(AOPS)을 적용하여 SLIM RNN을 온라인으로 성장시키며, prefix 종속성과 일치하도록 가중치를 업데이트한다.
  • 각 연결에 대해 과제 목록을 유지하여, 각 가중치가 어떤 과제에 의존하는지 추적함으로써 국소적 가중치 변경 후 성능 재평가를 효율적으로 수행할 수 있도록 한다.
  • 3차원 다중 프로세서 하드웨어에서 활성 연결의 과제별 총 와이어 길이를 최소화하는 학습 목표를 제안하며, 과제별 하위작업을 위한 물리적으로 국소화된 하위네트워크를 선호한다.

실험 결과

연구 질문

  • RQ1기존에 자기 종료 구조를 갖지 않는 순환 신경망(RNNs)에 대해 점근적으로 최적의 프로그램 탐색(AOPS)을 효과적으로 적용할 수 있는가?
  • RQ2각 계산 에피소드에서 실제로 사용된 뉴런과 연결의 부분집합만을 동적으로 추적함으로써 신경망 추론과 학습을 더 효율적으로 만들 수 있는가?
  • RQ3SLIM NNs는 사전에 설정된 정규화나 하이퍼파rameter에 의존하지 않고 과적합을 자연스럽게 완화할 수 있는가?
  • RQ4국소적 가중치 변경 후 성능 평가 및 가중치 업데이트를 효율적으로 수행할 수 있는 메커니즘은 무엇인가?
  • RQ5미래의 SLIM NNs는 3차원 하드웨어에서 총 와이어 길이를 최소화함으로써 물리적으로 국소화되고 저지연 시간을 갖는 솔루션을 선호하도록 설계될 수 있는가?

주요 결과

  • SLIM NNs는 실행 중 활성 뉴런과 연결만을 추적함으로써 계산과 리셋을 효율적으로 수행하며, 네트워크의 최소한의 필수 부분에만 오버헤드를 초래한다.
  • SLIM NNs의 자기 종료 성격 덕분에 학습 시 오직 사용된 가중치만을 고려하게 되어, 학습 알고리즘이 비활성 매개변수를 무시하고 검색 공간을 크게 줄일 수 있다.
  • 런타임 중에 효과적인 크기를 동적으로 선택함으로써 SLIM NNs는 과적합을 내재적으로 방지하며, 유용할 경우 '스모트'해지고 필요에 따라만 확장된다.
  • 가중치 변경 후 성능 평가는 변경에 영향을 받는 과제의 합집합에 국한시킬 수 있어 검증과 학습 속도를 크게 향상시킨다.
  • AOPS와 SLIM NNs의 통합은 활성화 전파 중에 가중치 업데이트를 적용함으로써 일관성 있는 prefix 종속성을 유지하는 온라인 및 점진적 학습을 가능하게 한다.
  • 미래의 3D 뇌 유사 하드웨어에서 훈련된 SLIM NNs는 총 와이어 길이 최소화 목표에 의해 영향을 받아, 과제별 하위작업을 위한 물리적으로 국소화된 하위네트워크를 선호하는 가중치 행렬을 갖출 것으로 기대된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.