Skip to main content
QUICK REVIEW

[논문 리뷰] Optimal Rate of Convergence for Deep Neural Network Classifiers under the Teacher-Student Setting.

Tianyang Hu, Zuofeng Shang|arXiv (Cornell University)|2020. 01. 19.
Adversarial Robustness in Machine Learning참고 문헌 48인용 수 5
한 줄 요약

이 논문은 베이즈 분류기가 ReLU 네트워크로 모델링되는 테이처-스터디언트 프레임워크 하에서 깊이 있는 신경망 분류기의 날카운 수렴 속도를 확립한다. 0-1 손실과 허지 손실에 대해 $ ilde{O}_d(n^{-2/3})$의 최소최대 최적 수렴 속도를 도출하며, 분리 가능한 데이터 조건 하에서는 $ ilde{O}_d(n^{-1})$으로 향상된다. 차원 수는 수렴 속도에 영향을 주는 로그 항목에만 영향을 미친다.

ABSTRACT

Classifiers built with neural networks handle large-scale high dimensional data, such as facial images from computer vision, extremely well while traditional statistical methods often fail miserably. In this paper, we attempt to understand this empirical success in high dimensional classification by deriving the convergence rates of excess risk. In particular, a teacher-student framework is proposed that assumes the Bayes classifier to be expressed as ReLU neural networks. In this setup, we obtain a sharp rate of convergence, i.e., $ ilde{O}_d(n^{-2/3})$, for classifiers trained using either 0-1 loss or hinge loss. This rate can be further improved to $ ilde{O}_d(n^{-1})$ when the data distribution is separable. Here, $n$ denotes the sample size. An interesting observation is that the data dimension only contributes to the $\log(n)$ term in the above rates. This may provide one theoretical explanation for the empirical successes of deep neural networks in high dimensional classification, particularly for structured data.

연구 동기 및 목표

  • 깊이 있는 신경망의 고차원 분류 과제에서의 경험적 성공을 이론적으로 설명하는 것.
  • 구조화된 생성 모델 하에서 깊이 있는 신경망 분류기의 초과 위험 수렴 속도를 분석하는 것.
  • 입력 데이터의 차원 수가 고차원 환경에서 수렴 속도에 미치는 영향을 조사하는 것.
  • 테이처-스터디언트 설정 하에서 유도된 수렴 속도의 최소최대 최적성 확립

제안 방법

  • 베이즈 분류기가 ReLU 깊이 신경망임을 가정하는 테이처-스터디언트 프레임워크를 도입한다.
  • 유한 샘플에서 훈련된 스터디언트 네트워크에 대해 0-1 손실과 허지 손실 하에서 초과 위험을 분석한다.
  • ReLU 네트워크의 구조를 활용하여 초과 위험에 대한 비점근적 상한을 도출한다.
  • 차원 수의 역할을 수렴 속도의 로그 인자로 고립시키며, 차원에 의존하지 않는 복잡도 측도를 사용한다.
  • 더 빠른 수렴 속도를 도출하기 위해 분리 가능성 가정을 도입한다.
  • 상한의 날카로움을 확인하기 위해 최소최대 하한을 도출하여 최적성의 정당성을 확보한다.

실험 결과

연구 질문

  • RQ1베이즈 규칙이 ReLU 네트워크일 경우 깊이 있는 신경망 분류기의 최적 수렴 속도는 무엇인가?
  • RQ2입력 데이터의 차원 수가 깊이 있는 신경망 분류기의 수렴 속도에 어떤 영향을 미치는가?
  • RQ3데이터의 분리 가능성과 같은 더 강한 가정 하에서 더 빠른 수렴 속도를 달성할 수 있는가?
  • RQ4테이처-스터디언트 설정 하에서 유도된 수렴 속도는 최소최대 최적인가?

주요 결과

  • 이 논문은 0-1 또는 허지 손실로 훈련된 깊이 있는 신경망 분류기의 날카운 수렴 속도 $">\tilde{O}_d(n^{-2/3})$를 확립한다.
  • 데이터의 분리 가능성 가정 하에서는 수렴 속도가 $">\tilde{O}_d(n^{-1})$으로 향상되어 유리한 조건에서 더 빠른 학습을 가능하게 한다.
  • 입력 차원 수 $d$의 영향은 표본 크기 $n$에 대한 로그 항목에만 국한되어 있어 고차원성에 대해 강건함을 시사한다.
  • 유도된 속도는 최소최대 최적이며, 동일한 가정 하에서 어떤 분류기라도 더 빠른 속도를 달성할 수 없음을 확인한다.
  • 결과는 고차원 구조적 데이터 분류에서 깊이 있는 신경망의 경험적 성공에 대한 이론적 기반을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.