Skip to main content
QUICK REVIEW

[논문 리뷰] Deepest Neural Networks

Raúl Rojas|arXiv (Cornell University)|2017. 07. 09.
Neural Networks and Applications참고 문헌 2인용 수 4
한 줄 요약

이 논문은 깊이가 나쁨에도 불구하고, 각 은닉층의 너비가 1인 깊고 좁은 다층퍼셉트론(MLP)이 중첩된 볼록 다면체를 연쇄된 퍼셉트론을 통해 인코딩함으로써 데이터를 보편적으로 분류할 수 있음을 보여준다. 순차적인 선형 컷과 인버터를 사용하여 네트워크는 점점 더 복잡한 영역의 소속성을 테스트하며, 깊이가 넓이의 대체로 기능할 수 있음을 증명한다. 다만 이는 비효율적이다.

ABSTRACT

This paper shows that a long chain of perceptrons (that is, a multilayer perceptron, or MLP, with many hidden layers of width one) can be a universal classifier. The classification procedure is not necessarily computationally efficient, but the technique throws some light on the kind of computations possible with narrow and deep MLPs.

연구 동기 및 목표

  • 깊고 좁은 MLP(은닉층 너비가 1인)가 보편적인 분류기로 작용할 수 있음을 보여주는 것.
  • 좁고 깊은 네트워크의 계산 능력을 넓고 浅인 네트워크와 대조하여 탐구하는 것.
  • 이진 출력을 가진 퍼셉트론의 체인과 볼록 영역의 모듈러한 중첩을 통해 보편적인 분류가 가능함을 보여주는 것.
  • 깊이만으로도 보편 근사가 가능함을 증명함으로써 깊은 네트워크에 대한 이론적 기반을 제공하는 것.

제안 방법

  • 모든 퍼셉트론이 입력 공간에서 선형 컷을 테스트하는 체인을 사용하며, 내적 값이 유계로 유지되도록 가중치를 스케일링한다.
  • 모든 퍼셉트론이 발화할 경우, 항상 전방으로 '화염' 신호를 전파하는 데 큰 양의 가중치 S를 사용하여, 후행 퍼셉트론이 입력에 관계없이 항상 발화하도록 보장한다.
  • 체인의 끝에 위치한 인버터는 체인 내 모든 퍼셉트론이 0을 출력할 때만 1을 출력하며, 이는 내부 볼록 영역에 속함을 나타낸다.
  • 반복적으로 볼록 캄ouflage(R1, R2, ...)를 구성하며, 각 영역은 이전 영역의 여집합 내에 하나의 클래스를 둘러싸도록 한다.
  • 내부 영역용 체인을 재사용하여 하위 모듈로 활용함으로써, 더 깊은 체인에서 R1−R2+R3−R4+R5와 같은 점점 더 복잡한 영역을 위한 분류기를 구축한다.
  • 모든 층을 거쳐 원본 입력을 전달하는 '단축' 구조를 사용함으로써 깊이 전반에 걸쳐 일관된 평가가 가능해진다.

실험 결과

연구 질문

  • RQ1은닉층 너비가 1인 깊은 신경망이 두 개의 서로소 데이터 클래스를 보편적으로 분류할 수 있는가?
  • RQ2어떻게 순차적 체인에서 퍼셉트론만을 사용하여 중첩된 볼록 다면체를 인코딩할 수 있는가?
  • RQ3큰 가중치를 통해 '화염' 신호를 전파하는 것이 층 간 논리적 일관성을 유지하는 데 어떤 역할을 하는가?
  • RQ4넓은 은닉층 없이 깊이와 최소 너비만으로도 보편적인 분류를 달성할 수 있는가?
  • RQ5퍼셉트론 체인의 모듈러한 재사용은 어떻게 비볼록 영역을 가진 복잡한 데이터 영역을 분류하는 데 기여하는가?

주요 결과

  • 은닉층 너비가 1인 깊은 MLP는 두 개의 서로소 데이터 클래스가 중첩된 볼록 다면체로 표현될 수 있다면 보편적으로 분류할 수 있다.
  • 모든 층에서 발화가 발생할 경우 큰 가중치 S를 통해 신호가 전방으로 전파되어 후행 층이 입력과 무관하게 항상 발화하도록 보장하는 퍼셉트론 체인을 사용한다.
  • 체인의 끝에 위치한 인버터는 체인 내 모든 퍼셉트론이 0을 출력할 때만 1을 출력하며, 이는 내부 볼록 영역에 속함을 정확히 식별한다.
  • 서브모듈을 재귀적으로 조합하여 복잡한 영역을 위한 분류기를 구축함으로써, R1−R2+R3−R4+R5와 같은 영역을 인식할 수 있다.
  • 중첩 과정이 느리거나 영역들이 임의로 가까이 있어도, 시퀀스가 종료된다면 증명이 성립한다.
  • 이 아키텍처는 깊이가 넓이의 대체로 기능할 수 있음을 보여주며, 넓고 얕은 네트워크의 고전적 보편 근사 정리에 대한 '쌍대'를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.