[논문 리뷰] Discovering Neural Wirings
이 논문은 딥 뉴럴 와이어링(DNW)을 제안하며, 채널 간 연결을 독립적으로 형성할 수 있도록 허용함으로써 신경망 내에서 희박하고 동적인 연결 패턴을 학습하는 방법이다. 이는 종단 간 구조 및 가중치 학습을 가능하게 하며, 약 41M FLOPs에서 MobileNetV1보다 10% 높은 ImageNet 정확도를 달성한다. 수작업으로 설계된 네트워크나 무작위로 연결된 네트워크를 능가하며, 순환 및 연속 시간 네트워크로의 일반화도 가능하다.
The success of neural networks has driven a shift in focus from feature engineering to architecture engineering. However, successful networks today are constructed using a small and manually defined set of building blocks. Even in methods of neural architecture search (NAS) the network connectivity patterns are largely constrained. In this work we propose a method for discovering neural wirings. We relax the typical notion of layers and instead enable channels to form connections independent of each other. This allows for a much larger space of possible networks. The wiring of our network is not fixed during training -- as we learn the network parameters we also learn the structure itself. Our experiments demonstrate that our learned connectivity outperforms hand engineered and randomly wired networks. By learning the connectivity of MobileNetV1we boost the ImageNet accuracy by 10% at ~41M FLOPs. Moreover, we show that our method generalizes to recurrent and continuous time networks. Our work may also be regarded as unifying core aspects of the neural architecture search problem with sparse neural network learning. As NAS becomes more fine grained, finding a good architecture is akin to finding a sparse subnetwork of the complete graph. Accordingly, DNW provides an effective mechanism for discovering sparse subnetworks of predefined architectures in a single training run. Though we only ever use a small percentage of the weights during the forward pass, we still play the so-called initialization lottery with a combinatorial number of subnetworks. Code and pretrained models are available at https://github.com/allenai/dnw while additional visualizations may be found at https://mitchellnw.github.io/blog/2019/dnw/.
연구 동기 및 목표
- 신경망의 고정된 아키텍처 빌딩 블록의 한계를 극복하기 위해 동적이고 학습 가능한 연결성을 가능하게 하기 위해.
- 층 기반 제약 조건을 완화하고 임의의 채널 간 연결을 허용함으로써 신경망 아키텍처 탐색(NAS)의 제약된 검색 공간을 해결하기 위해.
- 희박한 신경망 학습과 신경망 아키텍처 탐색을 통합하기 위해, 단일 학습 런 동안 고성능 서브넷을 발견하기 위해.
- 수동으로 설계된 또는 무작위로 연결된 아키텍처보다 연결 패턴을 학습하는 것이 더 높은 성능을 낼 수 있음을 입증하기 위해.
- 전방향 모델을 넘어서 순환 및 연속 시간 네트워크로의 적용 가능성을 넓히기 위해.
제안 방법
- 기존의 레이어를 대체하여, 각 채널이 다른 채널과 독립적으로 연결될 수 있는 유연한 와이어링 메커니즘을 도입함으로써 잠재적 연결의 완전한 그래프를 형성한다.
- 연결성은 미분 가능하며, 미분 가능한 아키텍처 탐색 방법을 사용해 가중치와 함께 동시에 학습된다.
- 추론 시에는 소수의 연결만 선택하는 희박한 라우팅 메커니즘을 사용하여 FLOPs를 줄이면서도 성능를 유지한다.
- 아키텍처는 종단 간으로 학습되며, 가중치와 연결 패턴이 동시에 최적화될 수 있도록 한다.
- 아키텍처 탐색을 조합적 로또로 간주하여, 매우 많은 수의 희박한 서브넷에서 초기화 로또를 시행한다.
- 순차적 및 시간적 계산에 적합하게 와이어링 메커니즘을 조정함으로써 순환 및 연속 시간 네트워크로의 일반화를 달성한다.
실험 결과
연구 질문
- RQ1신경망의 연결성이 아키텍처 설계에 의해 고정되는 대신 종단 간으로 학습될 수 있는가?
- RQ2희박하고 동적인 와이어링을 학습하는 것이 수작업 또는 무작위로 연결된 네트워크보다 더 높은 성능을 낼 수 있는가?
- RQ3단일 학습 런 동안 완전한 그래프 아키텍처에서 고성능 서브넷을 발견할 수 있는가?
- RQ4ImageNet에서 학습된 와이어링의 성능가 표준 아키텍처인 MobileNetV1과 비교해 어떻게 되는가?
- RQ5이 방법은 순환 및 연속 시간 신경망으로까지 확장될 수 있는가?
주요 결과
- 제안된 방법은 약 41M FLOPs만을 사용하면서도 MobileNetV1보다 ImageNet top-1 정확도를 10% 향상시켰다.
- 학습된 연결 패턴은 다양한 벤치마크에서 수작업 설계된 네트워크나 무작위로 연결된 네트워크를 모두 능가하는 성능을 보였다.
- 단일 학습 런 동안 완전한 그래프 아키텍처에서 고성능 희박 서브넷을 발견하여, 조합적 아키텍처 탐색 문제를 효과적으로 해결하였다.
- 이 방법은 전방향 모델을 넘어서 순환 및 연속 시간 네트워크로도 일반화되어, 그 적용 범위가 넓음을 입증하였다.
- 단지 추론 시 소수의 가중치만 사용되더라도, 조합적 수의 희박한 서브넷에서 초기화 로또를 시행할 수 있는 형태를 제공한다.
- 코드와 사전 학습된 모델이 공개되어 있어 재현성과 희박한 아키텍처 탐색 분야의 추가 연구를 지원한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.