Skip to main content
QUICK REVIEW

[논문 리뷰] Whitening and second order optimization both destroy information about the dataset, and can make generalization impossible

Neha S. Wadia, Daniel Duckworth|arXiv (Cornell University)|2021. 05. 04.
Stochastic Gradient Optimization Techniques참고 문헌 83인용 수 7
한 줄 요약

이 논문은 완전히 연결된 첫 번째 레이어를 가진 모델에서 일반화에 필수적인 샘플-샘플 제2모멘트 행렬의 핵심 정보를 데이터 화이트닝과 특정 이阶 최적화 방법이 파괴함을 보여준다. 고차원 설정에서는 이러한 정보 손실로 인해 일반화가 불가능해질 수 있으나, 정규화된 이阶 최적화는 일부 일반화 능력을 유지하는 실용적인 트레이드오프를 제공한다.

ABSTRACT

Machine learning is predicated on the concept of generalization: a model achieving low error on a sufficiently large training set should also perform well on novel samples from the same distribution. We show that both data whitening and second order optimization can harm or entirely prevent generalization. In general, model training harnesses information contained in the sample-sample second moment matrix of a dataset. For a general class of models, namely models with a fully connected first layer, we prove that the information contained in this matrix is the only information which can be used to generalize. Models trained using whitened data, or with certain second order optimization schemes, have less access to this information; in the high dimensional regime they have no access at all, resulting in poor or nonexistent generalization ability. We experimentally verify these predictions for several architectures, and further demonstrate that generalization continues to be harmed even when theoretical requirements are relaxed. However, we also show experimentally that regularized second order optimization can provide a practical tradeoff, where training is accelerated but less information is lost, and generalization can in some circumstances even improve.

연구 동기 및 목표

  • 완전히 연결된 첫 번째 레이어를 가진 머신러닝 모델에서 데이터 화이트닝과 이阶 최적화 방법이 일반화에 필요한 정보에 어떤 영향을 미치는지 조사하기.
  • 완전히 연결된 첫 번째 레이어를 가진 모델에서 샘플-샘플 제2모멘트 행렬이 일반화에 관련된 정보의 주요 원천임을 규명하기.
  • 이러한 기법들이 고차원 설정에서 이 정보에 대한 액세스를 완전히 제거할 수 있음을 입증하여 일반화 성능이 열악하거나 전혀 이루어지지 않게 됨을 보여주기.
  • 정규화된 이阶 최적화가 정보 손실를 완화하면서도 학습 속도의 이점을 유지할 수 있는지 탐색하기.

제안 방법

  • 완전히 연결된 첫 번째 레이어를 가진 모델에 대해 이론적 분석을 수행하여 일반화가 샘플-샘플 제2모멘트 행렬에 포함된 정보에만 의존함을 입증한다.
  • 데이터 화이트닝과 특정 이阶 최적화 기법(예: 자연 경사법)이 이 행렬에 대한 액세스를 감소하거나 제거하는 조건을 유도한다.
  • 고차원 점근적 분석을 통해 고차원 근처에서 이러한 방법들이 제2모멘트 행렬에 대한 전반적인 액세스를 상실함을 보여준다.
  • 다양한 아키텍처를 대상으로 실험을 수행하여 화이트닝과 이阶 최적화 하에서 이론적 예측된 일반화 실패를 확인한다.
  • 정규화된 이阶 최적화의 변종을 제안하고 시험하여 학습 속도의 이점을 유지하면서도 일반화에 필요한 정보를 충분히 유지할 수 있는지 평가한다.
  • 다양한 모델 아키텍처에서 표준, 화이트닝, 정규화된 이阶 최적화 설정 하에서의 일반화 성능을 비교하는 실험을 수행한다.

실험 결과

연구 질문

  • RQ1데이터 화이트닝은 완전히 연결된 모델에서 일반화에 필수적인 샘플-샘플 제2모멘트 행렬의 정보를 제거하는가?
  • RQ2자연 경사법과 같은 이阶 최적화 방법은 고차원 설정에서 완전한 일반화 능력을 상실하게 하는가?
  • RQ3제2모멘트 정보 손실이 딥러닝 모델에서 낮은 테스트 성능과 얼마나 관련이 있는가?
  • RQ4정규화된 이阶 최적화는 학습 속도의 이점을 유지하면서도 충분한 정보를 유지해 일반화를 가능하게 할 수 있는가?
  • RQ5정규화를 적용한 이阶 최적화를 사용할 때 일반화를 향상시키거나 유지할 수 있는 조건는 무엇인가?

주요 결과

  • 데이터 화이트닝과 특정 이阶 최적화 기법은 완전히 연결된 첫 번째 레이어 모델에서 일반화에 관련된 정보의 유일한 원천인 샘플-샘플 제2모멘트 행렬에 대한 액세스를 파괴한다.
  • 고차원 설정에서는 이러한 방법들이 제2모멘트 행렬에 대한 액세스를 완전히 상실하여 일반화가 불가능하게 된다.
  • 실험 결과는 다양한 아키텍처에서 화이트닝 데이터와 표준 이阶 최적화 하에서 일반화 성능이 크게 떨어짐을 확인한다.
  • 이론적 가정이 느슨해져도 일반화 능력은 손상된 상태를 유지하여 실제 설정에서도 문제가가 지속됨을 보여준다.
  • 정규화된 이阶 최적화는 실용적인 트레이드오프를 제공한다: 학습 속도를 가속하면서도 일반화에 필요한 정보를 충분히 유지하며, 일부 경우에서는 일반화 성능까지 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.