Skip to main content
QUICK REVIEW

[논문 리뷰] Consistent estimation of the architecture of multilayer perceptrons

Joseph Rynkiewicz|ArXiv.org|2008. 02. 22.
Neural Networks and Applications참고 문헌 9인용 수 6
한 줄 요약

이 논문은 과적합 시 매개변수의 식별불가성으로 인해 특이적인 피셔 정보행렬을 가질 수 있는 단일 은닉층 다층퍼셉트론(MLP)의 아키텍처 선택에 대해 BIC와 같은 정보기준의 이론적 일致성을 확립한다. 매개변수 비정규화를 통해 식별가능 및 식별불가능 성분을 분리하고, Gassiat 및 Liu & Shao의 최신 渐近 이론을 적용함으로써, 유계 매개변수 제약 조건 하에서 우도비 통계량이 여전히 강한 수렴성을 유지함을 증명함으로써, 표본 크기가 증가함에 따라 BIC는 참값의 은닉 유닛 수를 일致적으로 선택함을 보장한다.

ABSTRACT

We consider regression models involving multilayer perceptrons (MLP) with one hidden layer and a Gaussian noise. The estimation of the parameters of the MLP can be done by maximizing the likelihood of the model. In this framework, it is difficult to determine the true number of hidden units using an information criterion, like the Bayesian information criteria (BIC), because the information matrix of Fisher is not invertible if the number of hidden units is overestimated. Indeed, the classical theoretical justification of information criteria relies entirely on the invertibility of this matrix. However, using recent methodology introduced to deal with models with a loss of identifiability, we prove that suitable information criterion leads to consistent estimation of the true number of hidden units.

연구 동기 및 목표

  • 과적합으로 인한 매개변수 식별불가성으로 인해 특이적인 피셔 정보행렬을 가질 수 있는 다층퍼셉트론의 아키텍처 선택에 있어 BIC와 같은 정보기준의 이론적 일치성 부족 문제를 해결하기 위해.
  • 과적합된 모델에서도 고전적 정보기준이 일관되게 작동할 수 있는 충분한 조건을 설정하기 위해.
  • BIC와 같은 펜리드 우도 방법의 실용적 사용을 정당화하기 위해, 그 일관성에 대한 엄밀한 渐近 기반을 제공하기 위해.
  • 비정규 모델에 대한 최신 渐近 이론을 유계 매개변수를 가진 피드포워드 신경망의 맥락으로 확장하기 위해.
  • 유계 매개변수 제약 조건 하에서 우도비 통계량이 여전히 강한 수렴성을 유지함을 보여주어 BIC 수렴성 확보하기 위해.

제안 방법

  • 진짜 은닉 유닛 수 $k^0$ 기반으로 동일한 매개변수를 식별가능 및 식별불가능 성분으로 묶는 파artitioning 기반의 재매개변수화를 통해 MLP 모델을 재정의한다.
  • 매개변수 $\theta = (\Phi_t, \psi_t)$ 를 도입하여 $\Phi_t$ 는 식별가능 부분, $\psi_t$ 는 식별불가능 부분을 나타내며, $\Phi_t = \Phi_t^0$ 인 경우에만 $F_{(\Phi_t^0, \psi_t)} = F_{\theta^0}$ 가 성립하도록 보장한다.
  • 진짜 매개변수 주변에서 로그우도의 타일러 전개를 이용해 우도비 통계량의 渐近 전개를 유도하며, 활성화 함수 $\phi$ 의 유계성 및 미분가능성에 대한 가정을 활용한다.
  • Donsker 클래스 조건을 적용하여 $\Phi_t$ 에 의해 인덱싱된 스코어 함수들이 Donsker 클래스를 이룬다는 것을 보이며, 이는 경험과정의 약한 수렴 가능성을 보장한다.
  • Gassiat(2002)의 정리에 기반해, 유계 매개변수 제약 조건 하에서 우도비 통계량이 강한 수렴성을 가지며, 이는 BIC의 일관성을 의미한다.
  • 스코어 함수 클래스를 덮기 위해 필요한 최소 $\epsilon$-브라켓 수가 $O(\epsilon^{-3k^0})$ 의 속도로 증가함을 증명함으로써 Donsker 성질을 확인한다.

실험 결과

연구 질문

  • RQ1과적합으로 인해 특이적인 피셔 정보행렬을 가질 수 있는 다층퍼셉트론에서 BIC와 같은 정보기준이 은닉 유닛의 참값을 일관되게 추정할 수 있는가?
  • RQ2비정규 모델, 예를 들어 유계 매개변수를 가진 과적합된 MLP에서 우도비 통계량이 강한 수렴성을 유지하는 조건은 무엇인가?
  • RQ3비정규성으로 인해 매개변수의 참값이 저차원 부분다양체 위에 있을 경우, BIC의 고전적 정당화 방식은 여전히 유효한가?
  • RQ4최근의 비정규 모델에 대한 渐近 이론은 피드포워드 신경망의 펜리드 우도 기반 모델 선택에 대한 이론적 기반을 제공할 수 있는가?
  • RQ5매개변수 공간을 유계로 제한함으로써 과적합된 MLP에서 정보기준인 BIC의 일관성은 복구될 수 있는가?

주요 결과

  • 매개변수가 컴act 집합 내에서 유계일 경우, BIC 기준은 단일 은닉층 MLP에서 참 은닉 유닛 수를 일관되게 선택할 수 있다.
  • 피셔 정보행렬이 식별불가성으로 인해 특이하더라도, 유계 매개변수 제약 조건 하에서 우도비 통계량은 여전히 강한 수렴성을 유지한다.
  • 매개변수 벡터의 식별가능 부분에 의해 인덱싱된 스코어 함수 클래스는 Donsker 클래스를 이룬다. 이는 우도비의 약한 수렴성 및 渐近 정규성을 보장하는 데 필수적이다.
  • 스코어 함수 클래스를 덮기 위해 필요한 최소 $\epsilon$-브라켓 수는 $O(\epsilon^{-3k^0})$ 의 속도로 증가하며, 이는 Donsker 성질을 확인하고 渐近 이론을 뒷받침한다.
  • 재매개변수화 접근법은 식별가능 및 식별불가능 성분을 효과적으로 분리하여, 비정규 모델에 고급 渐近 도구를 적용할 수 있도록 한다.
  • 이 연구는 BIC 및 유사한 펜리드 우도 기준이 MLP 아키텍처 선택에서 널리 경험적으로 성공한 데 대한 이론적 정당화를 처음으로 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.