Skip to main content
QUICK REVIEW

[논문 리뷰] Intrinsic dimension of data representations in deep neural networks

Alessio Ansuini, Alessandro Laio|arXiv (Cornell University)|2019. 05. 29.
Face and Expression Recognition참고 문헌 35인용 수 129
한 줄 요약

이 논문은 학습된 CNN의 표현이 저차원 곡선 매니폴드에 놓여 있으며 그 고유 차원(ID)이 계층 크기보다 훨씬 작고, ID가 초기 계층에서 증가했다가 점진적으로 감소하며, 마지막 계층의 ID가 테스트 정확도를 예측한다는 것을 보여준다.

ABSTRACT

Deep neural networks progressively transform their inputs across multiple processing layers. What are the geometrical properties of the representations learned by these networks? Here we study the intrinsic dimensionality (ID) of data-representations, i.e. the minimal number of parameters needed to describe a representation. We find that, in a trained network, the ID is orders of magnitude smaller than the number of units in each layer. Across layers, the ID first increases and then progressively decreases in the final layers. Remarkably, the ID of the last hidden layer predicts classification accuracy on the test set. These results can neither be found by linear dimensionality estimates (e.g., with principal component analysis), nor in representations that had been artificially linearized. They are neither found in untrained networks, nor in networks that are trained on randomized labels. This suggests that neural networks that can generalize are those that transform the data into low-dimensional, but not necessarily flat manifolds.

연구 동기 및 목표

  • CNN의 계층 간 표현의 고유 차원성이 어떻게 변화하는지 정량화한다.
  • 학습된 표현이 선형 부분공간이 아닌 저차원, 곡선 형태의 매니폴드에 놓여 있는지 판단한다.
  • 마지막 은닉 계층의 ID와 일반화 성능 간의 관계를 조사한다.
  • 랜덤 레이블로 학습된 네트워크와 학습되지 않은 네트워크 간의 ID 프로파일 차이가 있는지 평가한다.

제안 방법

  • 첫 번째 이웃 간 거리의 비율에 기초한 글로벌 고유 차원 추정기인 TwoNN을 사용해 계층 활성화의 ID를 추정한다.
  • 다수의 아키텍처(VGG, AlexNet, ResNet)와 계층 및 데이터셋에 대해 TwoNN을 적용한다.
  • PC-ID와의 비교를 통해 선형 구조 대 비선형 구조를 평가한다.
  • 스케일 불변성과 추정의 견고성을 확인하기 위해 서브샘플링 분석을 수행한다.
  • CIFAR-10 및 MNIST 변형에서 학습 중 ID 진화를 추적해 학습 역학을 분석한다.
  • 일반화의 영향을 구분하기 위해 임의의 레이블로 학습된 네트워크를 테스트한다.

실험 결과

연구 질문

  • RQ1CNN의 계층 간 고유 차원성은 어떻게 변하는가?
  • RQ2CNN 표현의 데이터 매니폴드는 저차원이고 곡선적인가, 평평한가?
  • RQ3마지막 은닉 계층의 ID가 네트워크의 일반화 성능을 예측하는가?
  • RQ4학습되지 않은 네트워크나 임의의 레이블로 학습된 네트워크가 표준 학습 네트워크와 동일한 ID 프로파일을 보이는가?
  • RQ5이 표현들에서 PC-ID 기반의 선형 차원 추정치와 비선형 고유 차원 추정치가 어떻게 비교되는가?

주요 결과

  • CNN의 데이터 표현은 ED(embedding dimension)보다 훨씬 작은 ID를 가진 저차원 매니폴드에 위치한다.
  • 계층 전반에서 ID는 초기 계층에서 일반적으로 증가한 뒤 최종 은닉 계층으로 갈수록 단조롭게 감소한다.
  • 마지막 은닉 계층의 ID는 테스트 집합의 정확도를 강하게 예측한다( ID가 낮을수록 예측력이 더 높다 ).
  • TwoNN의 ID 추정은 PCA로 포착되지 않는 곡선적이고 저차원 매니폴드를 보여주며 PC-ID는 훨씬 높다.
  • 임의로 초기화된 네트워크는 평평한 ID 프로파일을 보이고, 임의 레이블로 학습된 네트워크는 일반화와 연결된 일반적인 ID 감소 패턴을 보이지 않아 일반화와 ID 감소가 연관되어 있음을 시사한다.
  • 아키텍처(VGG, AlexNet, ResNet) 간 ID 경향은 상대 깊이 관점에서 대체로 일관된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.