Skip to main content
QUICK REVIEW

[논문 리뷰] Order and Chaos: NTK views on DNN Normalization, Checkerboard and Boundary Artifacts

Arthur Paul Jacot, Franck Gabriel|arXiv (Cornell University)|2019. 07. 11.
Parallel Computing and Optimization Techniques참고 문헌 29인용 수 12
한 줄 요약

이 논문은 신경미분기호 커널(NTK)을 사용하여 딥 네ural 네트워크를 분석하며, 아키텍처 선택에 의해 지배되는 두 가지 정규화 상태인 '질서'와 '혼돈'을 규명한다. Layer Normalization과 Batch Normalization이 GAN에서 체크아웃 패턴과 모드 붕괴를 방지하기 위해 네트워크를 혼돈 상태로 이끈다는 것을 보여주며, Batch Normalization을 사용하지 않고도 훈련 안정성과 샘플 품질을 향상시키기 위해 그래프 기반 파arametrization과 계층별 학습률을 제안한다.

ABSTRACT

We analyze architectural features of Deep Neural Networks (DNNs) using the so-called Neural Tangent Kernel (NTK), which describes the training and generalization of DNNs in the infinite-width setting. In this setting, we show that for fully-connected DNNs, as the depth grows, two regimes appear: "order", where the (scaled) NTK converges to a constant, and "chaos", where it converges to a Kronecker delta. Extreme order slows down training while extreme chaos hinders generalization. Using the scaled ReLU as a nonlinearity, we end up in the ordered regime. In contrast, Layer Normalization brings the network into the chaotic regime. We observe a similar effect for Batch Normalization (BN) applied after the last nonlinearity. We uncover the same order and chaos modes in Deep Deconvolutional Networks (DC-NNs). Our analysis explains the appearance of so-called checkerboard patterns and border artifacts. Moving the network into the chaotic regime prevents checkerboard patterns; we propose a graph-based parametrization which eliminates border artifacts; finally, we introduce a new layer-dependent learning rate to improve the convergence of DC-NNs. We illustrate our findings on DCGANs: the ordered regime leads to a collapse of the generator to a checkerboard mode, which can be avoided by tuning the nonlinearity to reach the chaotic regime. As a result, we are able to obtain good quality samples for DCGANs without BN.

연구 동기 및 목표

  • 배치 정규화와 레이어 정규화와 같은 정규화 기법이 DNN 훈련 다이내믹스에 미치는 이론적 영향을 이해하는 것.
  • 디컨볼루션 네트워크에서 발생하는 체크아웃 패턴과 가장자리 아티팩트의 발생 원인을 NTK 프레임워크를 통해 설명하는 것.
  • 배치 정규화에 의존하지 않고도 GAN에서 모드 붕괴를 방지할 수 있는 아키텍처 및 최적화 개선 방법을 개발하는 것.
  • 무한한 너비를 가진 네트워크에서의 질서-혼돈 전이와 깊이 있는 생성 모델의 실제 훈련 행동 간의 연결 고리를 설정하는 것.

제안 방법

  • 완전히 연결된 네트워크와 디컨볼루션 네트워크를 무한한 너비 근사에서 분석하여 NTK를 사용해 가중치와 편향 기여도를 연구한다.
  • 다양한 비선형성과 정규화 기법 하에서 NTK의 극한 행동을 유도하며, 일정한 NTK를 가지는 '질서' 상태와 크로네커 델타로 수렴하는 '혼돈' 상태를 식별한다.
  • 가중치 공유 구조를 수정함으로써 디컨볼루션 네트워크의 가장자리 아티팩트를 제거하기 위해 그래프 기반 파arametrization을 제안한다.
  • 각 계층의 기여도를 균형 있게 유지하고 깊이 있는 생성 모델에서 수렴을 향상시키기 위해 계층별 학습률을 도입한다.
  • 스케일된 ReLU 비선형성을 사용하여 네트워크가 질서 상태로 이동하도록 유도하며, 이는 레이어 정규화가 혼돈 상태로 이동시키는 것과 대비한다.
  • 이론적 결과를 DCGAN에서 수치적으로 검증하여 배치 정규화 없이도 향상된 샘플 품질을 달성함을 보여준다.

실험 결과

연구 질문

  • RQ1배치 정규화와 레이어 정규화와 같은 정규화 기법이 깊은 네트워크에서 NTK와 훈련 다이내믹스에 어떻게 영향을 미치는가?
  • RQ2왜 디컨볼루션 네트워크에서 체크아웃 패턴과 가장자리 아티팩트가 발생하며, 이는 어떻게 이론적으로 설명될 수 있는가?
  • RQ3아키텍처 선택을 통해 NTK의 혼돈 상태를 달성할 수 있는가? 이를 통해 GAN에서의 모드 붕괴를 방지할 수 있는가?
  • RQ4비선형성과 파arametrization은 깊은 네트워크에서 NTK의 극한 행동을 결정하는 데 어떤 역할을 하는가?
  • RQ5학습률 스케줄링을 어떻게 계층별 기여도에 맞게 조정하여 NTK 프레임워크에서 훈련 안정성을 향상시킬 수 있는가?

주요 결과

  • 레이어 정규화는 완전히 연결된 네트워크를 혼돈 상태로 이동시키며, 이 경우 NTK는 크로네커 델타로 수렴하여 일반화 성능 향상과 모드 붕괴 방지를 유도한다.
  • 최종 비선형성 이후 적용된 배치 정규화 역시 디컨볼루션 네트워크에서 체크아웃 아티팩트를 억제하기 위해 혼돈 상태의 NTK를 유도한다.
  • 표준 디컨볼루션 네트워크 파arametrization은 비균일한 NTK 기여도로 인해 가장자리 아티팩트를 유발하지만, 제안된 그래프 기반 파arametrization으로 이를 제거할 수 있다.
  • 계층별 학습률을 사용하면 각 계층의 기여도가 균형을 이루며 깊이 있는 생성 모델에서 수렴 성능이 향상된다.
  • 배치 정규화 없이도 비선형성 정규화와 적절한 하이퍼파ram터 튜닝을 통해 고품질의 샘플을 생성할 수 있는 단순한 DCGAN을 설계할 수 있다.
  • 스케일된 ReLU를 사용한 질서 상태는 생성자 모델이 체크아웃 모드로 붕괴하는 결과를 낳지만, 네트워크를 혼돈 상태로 이동시키면 이를 방지할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.