Skip to main content
QUICK REVIEW

[논문 리뷰] Two Routes to Scalable Credit Assignment without Weight Symmetry

Daniel Kunin, Aran Nayebi|arXiv (Cornell University)|2020. 02. 28.
Advanced Memory and Neural Computing참고 문헌 32인용 수 16
한 줄 요약

이 논문은 가중치 대칭성이 없는 스케일러블 크레딧 할당을 위한 생물학적으로 타당한 두 가지 길을 제안한다: (1) 정규화 기반 가중치 정렬에서 유도된 강건한 국소 학습 규칙으로, 튜닝 없이 아키텍처 간에 잘 전이되며, (2) 역전파 성능을 따라잡고 노이즈가 있는 업데이트에 매우 강건한 비국소적 '가중치 추정' 규칙. 핵심 기여는 깊은 신경망에서 높은 성능를 유지하면서 역전파의 대안이 되는 스케일러블하고 신경적으로 타당한 방법을 규명한 데 있다.

ABSTRACT

The neural plausibility of backpropagation has long been disputed, primarily for its use of non-local weight transport $-$ the biologically dubious requirement that one neuron instantaneously measure the synaptic weights of another. Until recently, attempts to create local learning rules that avoid weight transport have typically failed in the large-scale learning scenarios where backpropagation shines, e.g. ImageNet categorization with deep convolutional networks. Here, we investigate a recently proposed local learning rule that yields competitive performance with backpropagation and find that it is highly sensitive to metaparameter choices, requiring laborious tuning that does not transfer across network architecture. Our analysis indicates the underlying mathematical reason for this instability, allowing us to identify a more robust local learning rule that better transfers without metaparameter tuning. Nonetheless, we find a performance and stability gap between this local rule and backpropagation that widens with increasing model depth. We then investigate several non-local learning rules that relax the need for instantaneous weight transport into a more biologically-plausible "weight estimation" process, showing that these rules match state-of-the-art performance on deep networks and operate effectively in the presence of noisy updates. Taken together, our results suggest two routes towards the discovery of neural implementations for credit assignment without weight symmetry: further improvement of local rules so that they perform consistently across architectures and the identification of biological implementations for non-local learning mechanisms.

연구 동기 및 목표

  • 신경망에서 역전파의 가중치 운반 요구 조건이 생물학적으로 타당하지 않다는 문제를 해결하기 위해.
  • 깊은 신경망에서 성능를 유지하면서 비국소적 가중치 운반을 피하는 스케일러블이고 국소적인 학습 규칙을 규명하기 위해.
  • 순시적 가중치 운반의 필요성을 완화하기 위해 가중치 추정을 통한 비국소적 학습 메커니즘을 탐색하기 위해.
  • 이 규칙들이 아키텍처 간에 전이 가능하고 노이즈가 있는 업데이트 조건에서 강건한지 평가하기 위해.
  • 기능적 신경 반응 데이터가 훈련된 네트워크에서 다양한 크레딧 할당 메커니즘을 구분할 수 있는지 평가하기 위해.

제안 방법

  • 전방 및 역방향 가중치가 동적으로 정렬되도록 정규화된 조건부 최적화 문제로 크레딧 할당을 수식화한다.
  • 기하학적 원소로 분해되는 정규화 항을 사용하여 통합 프레임워크를 도입함으로써 학습 규칙의 체계적 탐색을 가능하게 한다.
  • 연결되지 않은 전방 및 역방향 가중치 간의 정규화를 통해 형성된 의사기울기( pseudogradient )를 사용하는 대칭 정렬(SA) 기반 국소 학습 규칙을 제안한다.
  • 정확한 가중치 운반을 '가중치 추정' 과정으로 대체하는 비국소적 학습 규칙을 설계하며, 피드백 가중치를 통해 전치(transpose)를 근사한다.
  • 노이즈가 있는 업데이트로 모델을 훈련하여 강건성을 테스트하고, 동일한 노이즈 조건에서 SA와 역전파를 비교한다.
  • 기능적 신경 반응 데이터(영구성 시각 피질 V4, IT)를 PLS 회귀를 사용하여 분석하여 생물학적 타당성을 평가한다.

실험 결과

연구 질문

  • RQ1메타파rameter 튜닝 없이 다양한 깊은 신경망 아키텍처에서 역전파와 경쟁 가능한 성능을 내는 국소 학습 규칙를 설계할 수 있는가?
  • RQ2기존의 국소 규칙들인 피드백 정렬과 웨이트 미러가 왜 깊은 신경망으로 확장되지 못하는가? 그 불안정성의 수학적 특성은 무엇인가?
  • RQ3정확한 가중치 운반 대신 역방향 가중치를 추정하는 비국소적 학습 규칙가 최첨단 성능과 강건성을 달성할 수 있는가?
  • RQ4노이즈가 있는 기울기 업데이트 조건에서 대칭 정렬(SA)의 강건성은 역전파와 비교해 어떻게 되는가?
  • RQ5영구성 시각 피질의 기능적 신경 반응 데이터가 훈련된 네트워크에서 다양한 크레딧 할당 메커니즘을 구분할 수 있는가?

주요 결과

  • 제안된 대칭 정렬(SA) 규칙는 메타파rameter 튜닝 없이 ResNet-18 기반 ImageNet에서 경쟁 가능한 성능를 달성하며, 다양한 아키텍처로 전이되며 강건하게 작동한다.
  • SA는 역전파보다 노이즈가 있는 기울기 업데이트에 훨씬 더 강건하여, 기울기가 가우시안 노이즈에 의해 손상된 경우에도 성능를 유지한다.
  • 비국소적 가중치 추정 규칙는 깊은 신경망에서 최첨단 성능를 달성하며, 노이즈가 있는 업데이트 조건에서도 매우 안정적이며, 이는 역전파의 생물학적 대안으로 유력하게 제시된다.
  • 피드백 정렬를 제외한 모든 효과적인 학습 규칙들이 영구성 V4 및 IT 신경 반응에 대해 유사한 예측 정확도를 달성함으로써, 잘 훈련된 네트워크에서는 기능적 데이터가 학습 메커니즘을 구분하지 못할 수 있음을 시사한다.
  • 모델 깊이가 증가함에 따라 SA와 역전파 간의 성능 격차가 커지는 것을 확인하여, 국소 학습 규칙의 잔여 과제를 드러낸다.
  • 생물학적으로 타당한 크레딧 할당 연구를 지원하기 위해, 임의의 아키텍처와 학습 규칙을 대규모로 훈련할 수 있는 오픈소스 텐서플로 라이브러리가 공개된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.