Skip to main content
QUICK REVIEW

[논문 리뷰] Is deeper better? It depends on locality of relevant features

T. Mori, Masahito Ueda|arXiv (Cornell University)|2020. 05. 26.
Neural Networks and Applications참고 문헌 5인용 수 4
한 줄 요약

이 논문은 오버파rameterized 신경망에서 네트워크 깊이가 일반화에 어떻게 영향을 미치는지, 국소적 및 전역적 레이블을 가진 추상적 분류 과제를 통해 조사한다. 깊이가 깊은 네트워크는 혼돈스러운 신호 전파로 인한 특징 국소성 덕분에 국소적 레이블에 대해 더 잘 일반화되지만, 전역적 레이블에 대해서는 얕은 네트워크가 더 잘 성능을 내며, 이는 깊이의 이점이 표현력만이 아니라 특징 국소성에 의해 결정된다는 것을 시사한다.

ABSTRACT

It has been recognized that a heavily overparameterized artificial neural network exhibits surprisingly good generalization performance in various machine-learning tasks. Recent theoretical studies have made attempts to unveil the mystery of the overparameterization. In most of those previous works, the overparameterization is achieved by increasing the width of the network, while the effect of increasing the depth has remained less well understood. In this work, we investigate the effect of increasing the depth within an overparameterized regime. To gain an insight into the advantage of depth, we introduce local and global labels as abstract but simple classification rules. It turns out that the locality of the relevant feature for a given classification rule plays a key role; our experimental results suggest that deeper is better for local labels, whereas shallower is better for global labels. We also compare the results of finite networks with those of the neural tangent kernel (NTK), which is equivalent to an infinitely wide network with a proper initialization and an infinitesimal learning rate. It is shown that the NTK does not correctly capture the depth dependence of the generalization performance, which indicates the importance of the feature learning rather than the lazy learning.

연구 동기 및 목표

  • 오버파라미터라이제이션 영역에서 더 깊은 신경망이 더 잘 일반화되는 이유를 이해하기 위해.
  • 오버파라미터라이제이션된 네트워크에서 넓이를 초월해 깊이가 일반적인 이점을 제공하는지 조사하기 위해.
  • 일반화에 최적의 네트워크 깊이를 결정하는 데 특징 국소성(국소적 vs. 전역적 레이블)의 역할을 분석하기 위해.
  • 유한한 너비의 네트워크와 신경 탄성 커널(Neural Tangent Kernel, NTK) 극한을 비교하여, 레이지 학습이 깊이에 따른 일반화를 얼마나 정확히 예측하는지 평가하기 위해.
  • 깊은 네트워크에서의 혼돈스러운 신호 전파가 랜덤 레이블 학습 시에도 더 국소화된 특징을 학습하게 할 수 있는지 탐구하기 위해.

제안 방법

  • 저자들은 랜덤 입력과 두 가지 유형의 레이블(국소적 레이블: 몇 개의 입력 성분에 의해 결정됨, 전역적 레이블: 모든 성분의 합에 의해 결정됨)을 사용하여 추상적 분류 과제를 정의한다.
  • N=10^4개의 샘플을 가진 데이터셋에서, 너비 H=500으로 고정하고 깊이 L=1에서 L=7까지 다양하게 변화시킨 완전히 연결된 피드포워드 네트워크를 훈련하며, 학습률 η=0.1, 배치 크기 B=50인 SGD를 사용한다.
  • 일반화 성능은 테스트 오차를 통해 평가하고, 국소적 안정성은 강도 v의 국소적 펌터베이션에 대해 안정적인 테스트 샘플의 비율인 s(v)로 측정한다.
  • 본 연구는 유한한 너비의 네트워크를 신경 탄성 커널(NTK) 극한과 비교하며, 이는 무한한 너비와 무한소 학습률을 의미하며 레이지 학습 제도를 나타낸다.
  • 국소적 안정성은 개별 입력 차원을 따라 입력을 펌터베이션하고 레이블 불변성을 측정함으로써 분석되며, s(v)는 이러한 펌터베이션에 대한 저항력을 정량화한다.
  • 보조 실험을 통해 이슬링 모델에서 결과를 검증하였으며, 얕은 네트워크가 전역 열역학적 특징을 더 잘 분류함을 확인하였다.

실험 결과

연구 질문

  • RQ1오버파라미터라이제이션된 신경망에서 깊이를 늘리면 일반화 성능이 향상되는가? 만약 그렇다면 어떤 조건에서인가?
  • RQ2관련 특징의 국소성(국소적 vs. 전역적)이 일반화에 최적의 네트워크 깊이에 어떻게 영향을 미치는가?
  • RQ3신경 탄성 커널(NTK) 극한이 유한한 너비의 네트워크에서 일반화의 깊이 의존성을 얼마나 정확히 예측하는가?
  • RQ4유사한 표현력에도 불구하고 더 깊은 네트워크가 때로 더 잘 일반화되는 이유는 무엇인가?
  • RQ5깊은 네트워크에서의 혼돈스러운 신호 전파가, 랜덤 레이블 학습 시에도 더 국소화된 특징을 학습하게 할 수 있는가?

주요 결과

  • k-국소적 레이블에 대해 더 깊은 네트워크는 얕은 네트워크보다 유의미하게 낮은 일반화 오차를 달성하며, 이는 관련 특징이 국소적일 경우 깊이의 명백한 이점이 있음을 시사한다.
  • k-전역적 레이블에 대해서는 얕은 네트워크가 더 깊은 네트워크보다 더 잘 일반화되며, 이는 깊이가 항상 유리하지 않으며 전역적 특징 학습에 대해서는 오히려 해로울 수 있음을 보여준다.
  • 신경 탄성 커널(NTK) 극한은 일반화 성능의 깊이 의존성을 포착하지 못하며, 이는 레이지 학습을 초월한 특징 학습이 유한한 너비의 네트워크에서 일반화에 필수적임을 시사한다.
  • 랜덤 레이블 학습 시에도 더 깊은 네트워크는 더 얕은 네트워크보다 더 국소화된 특징을 학습하며, 이는 펌터베이션 하에서 낮은 국소적 안정성 s(v)로 입증된다.
  • 깊은 네트워크에서는 국소적 안정성 s(v)가 얕은 네트워크보다 훨씬 낮으며, 얕은 네트워크의 s(v)는 k-전역적 레이블과 매우 유사하다. 이는 얕은 네트워크가 더 전역적인 표현을 학습한다는 것을 시사한다.
  • 실제 물리적 맥락인 이슬링 모델에서의 테스트에서, 얕은 네트워크가 전역 열역학적 특징을 분류하는 데 더 뛰어난 성능을 보였으며, 이는 본 연구 결과가 물리적으로 관련된 맥락에서 검증됨을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.