Skip to main content
QUICK REVIEW

[논문 리뷰] How does Weight Correlation Affect the Generalisation Ability of Deep Neural Networks

Gaojie Jin, Xinping Yi|arXiv (Cornell University)|2020. 10. 12.
Generative Adversarial Networks and Image Synthesis참고 문헌 36인용 수 17
한 줄 요약

이 논문은 특성 상관관계를 분리함으로써 딥 네ural 네트워크의 은닉 표현 진화를 추적하기 위해 커널 기반 벡터 양자화 방법을 제안한다. 이는 훈련 에포크 전반에 걸쳐 지속적인 약한 상관관계가 더 나은 일반화와 강하게 관련되어 있음을 드러낸다. 이 방법은 표현을 공통의 입력 공간 기준 프레임으로 투영하여, 엔트로피 감소가 압축 그 자체가 아니라 상관관계 증가에 의해 이뤄진다는 것을 보여준다.

ABSTRACT

This paper studies the novel concept of weight correlation in deep neural networks and discusses its impact on the networks' generalisation ability. For fully-connected layers, the weight correlation is defined as the average cosine similarity between weight vectors of neurons, and for convolutional layers, the weight correlation is defined as the cosine similarity between filter matrices. Theoretically, we show that, weight correlation can, and should, be incorporated into the PAC Bayesian framework for the generalisation of neural networks, and the resulting generalisation bound is monotonic with respect to the weight correlation. We formulate a new complexity measure, which lifts the PAC Bayes measure with weight correlation, and experimentally confirm that it is able to rank the generalisation errors of a set of networks more precisely than existing measures. More importantly, we develop a new regulariser for training, and provide extensive experiments that show that the generalisation error can be greatly reduced with our novel approach.

연구 동기 및 목표

  • 정보 버블러 프레임워크에서 결정론적 DNN에 대한 상호정보량 추적의 한계를 해결하기 위해.
  • 은닉 표현 내 특성 상관관계가 훈련 중 일반화 및 엔트로피 진화에 어떻게 영향을 미치는지 조사하기 위해.
  • 상호정보량에 의존하지 않고도 상관관계가 있는 고차원 표현에서 엔트로피를 신뢰성 있게 추정할 수 있는 방법을 개발하기 위해.
  • 지속적인 약한 상관관계—압축이 아니라—가 딥 네트워크에서 일반화의 핵심 추진력임을 검증하기 위해.

제안 방법

  • 이 방법은 은닉 표현을 공통의 고차원 특성 공간(코드북)에 매핑하기 위해 커널 기반 벡터 양자화를 사용하며, 상관관계 영향을 분리한다.
  • 각 훈련 에포크의 표현을 단사 역전파를 통해 입력 공간으로 투영함으로써 엔트로피 추정치를 유지한다.
  • 이 접근법은 은닉 표현을 상관관계가 있는 다변량 랜덤 변수로 간주하고, 변환된 공간에서 표준 추정기(예: KDE)를 사용하여 근사 엔트로피 추정치 H(Bin(T))를 계산한다.
  • 입력 공간을 공통 기준 프레임으로 사용함으로써 H(T)와 H(Bin(T))가 투영에 대해 불변성을 유지하게 하여 일관된 추적을 가능하게 한다.
  • 은닉 표현의 공분산 구조를 명시적으로 모델링하여 엔트로피 감소에 대한 상관관계의 영향을 분리한다.
  • 예측 가능한 약한 상관관계를 유지하도록 하기 위해 급격히 감소하는 네트워크 아키텍처를 강제하는 구조적 정규화를 도입한다.

실험 결과

연구 질문

  • RQ1DNN 훈련 중 은닉 표현의 구성요소 간 상관관계는 어떻게 변화하는가?
  • RQ2상관관계는 딥 네트워크에서 엔트로피 감소에 어느 정도 기여하는가?
  • RQ3은닉 표현에서 지속적인 약한 상관관계는 더 나은 일반화 성능과 관련이 있는가?
  • RQ4결정론적 DNN에서 상호정보량에 의존하지 않고 엔트로피 진화를 신뢰성 있게 추적할 수 있는가?
  • RQ5정보 버블러 프레임워크에서 관측된 정보 압축은 실제로 압축이 아니라 상관관계에 의해 이뤄지는가?

주요 결과

  • 은닉 표현의 구성요소 간 상관관계는 훈련 중에 크게 증가하여, 구성요소가 독립적으로 진화한다는 가정과 정면으로 배치된다.
  • 은닉 표현의 엔트로피 감소는 정보 압축 그 자체가 아니라 상관관계 증가에 의해 주로 이뤄진다.
  • 훈련 전반에 걸쳐 지속적인 약한 상관관계는 뛰어난 일반화 성능의 강력한 지표이다.
  • 급격히 감소하는 아키텍처를 가진 네트워크는 약한 상관관계를 강제로 유도하고 더 나은 일반화를 달성함으로써 제안된 구조적 정규화의 타당성을 검증한다.
  • 이 방법은 상관관계 영향을 성공적으로 분리하여, 상관관계를 고려하지 않은 경우 전통적인 IB 기반 엔트로피 추적 방식이 편향됨을 보여준다.
  • MNIST, FashionMNIST, CIFAR10, SVHN에서의 실증적 검증을 통해 약한 상관관계가 낮은 테스트 오차와 향상된 일반화와 관련이 있음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.