Skip to main content
QUICK REVIEW

[논문 리뷰] Pruned Neural Networks are Surprisingly Modular

Daniel Filan, Shlomi Hod|arXiv (Cornell University)|2020. 03. 10.
Neural Networks and Applications참고 문헌 11인용 수 5
한 줄 요약

이 논문은 자르기 적용된 신경망에서 그래프 이론적 모듈성 측도를 도입하며, 내부 연결이 강하고 외부 연결이 약한 뉴런 클러스터를 모듈로 정의한다. 훈련된 및 자른 다층퍼셉트론(MLP)은 무작위 희박 네트워크보다 유의미하게 높은 모듈성을 보이며, 특히 드롭아웃을 사용해 훈련했을 때 더욱 그렇다. 또한 모듈은 기능적 중요성과 상호의존성을 보이며, 경사하강법과 자르기 과정이 모듈성 구조를 선호함을 시사한다.

ABSTRACT

The learned weights of a neural network are often considered devoid of scrutable internal structure. To discern structure in these weights, we introduce a measurable notion of modularity for multi-layer perceptrons (MLPs), and investigate the modular structure of MLPs trained on datasets of small images. Our notion of modularity comes from the graph clustering literature: a "module" is a set of neurons with strong internal connectivity but weak external connectivity. We find that training and weight pruning produces MLPs that are more modular than randomly initialized ones, and often significantly more modular than random MLPs with the same (sparse) distribution of weights. Interestingly, they are much more modular when trained with dropout. We also present exploratory analyses of the importance of different modules for performance and how modules depend on each other. Understanding the modular structure of neural networks, when such structure exists, will hopefully render their inner workings more interpretable to engineers. Note that this paper has been superceded by "Clusterability in Neural Networks", arxiv:2103.03386 and "Quantifying Local Specialization in Deep Neural Networks", arxiv:2110.08058!

연구 동기 및 목표

  • 뉴런 클러스터의 내부 및 외부 연결 기반으로 다층퍼셉트론(MLP)에 대한 측정 가능한 그래프 이론적 모듈성 개념을 개발한다.
  • 훈련된 및 자른 신경망이 랜덤 희박 네트워크를 초월해 학습된 가중치에서 모듈성 구조를 보이는지 조사한다.
  • 자른 MLP에서 식별된 모듈의 기능적 중요성과 상호의존성을 탐색한다.
  • 드롭아웃과 같은 훈련 제도가 신경망에서 모듈성의 발생에 어떤 영향을 미치는지 평가한다.

제안 방법

  • 뉴런을 정점으로, 인접한 층 간의 절대 가중치를 간의 가중치로 하는 가중치가 있는 무방향 그래프로 신경망을 표현한다.
  • 정규화된 컷( normalized cut ) 측도를 사용해 모듈로의 분할 품질을 평가하며, 높은 값일수록 더 좋은 모듈성을 의미한다.
  • 그래프의 라플라시안 행렬과 고유벡터를 기반으로 스펙트럴 클러스터링을 적용해 네트워크를 모듈로 분해한다.
  • 학습된 분할의 정규화된 컷을 동일한 희박성 조건을 가진 무작위 분할의 정규화된 컷과 비교함으로써 모듈성을 측정한다.
  • 단일 손상 실험을 통해 모듈의 중요도를 평가한다: 각 모듈의 가중치를 0으로 설정하고 정확도 감소를 측정한다.
  • 한 모듈을 손상시켰을 때 다른 모듈이 활성화되거나 비활성화된 상태에서의 조건부 정확도 손실을 측정함으로써 모듈 간 의존성을 분석한다.

실험 결과

연구 질문

  • RQ1이미지 데이터셋에서 훈련된 자른 신경망은 학습된 가중치에서 측정 가능한 모듈성 구조를 보이는가?
  • RQ2훈련된 및 자른 MLP의 모듈성은 동일한 가중치 분포를 가진 랜덤 희박 네트워크와 비교해 어떻게 다른가?
  • RQ3훈련 중 드롭아웃을 사용하면 신경망에서 모듈성 구조의 발생이 향상되는가?
  • RQ4어느 모듈이 기능적으로 중요하며, 성능 측면에서 서로 어떤 의존성을 가지는가?
  • RQ5모듈성이 훈련 과정에서 증가하는가? 그리고 학습 정확도와 상관관계가 있는가?

주요 결과

  • 작은 이미지 데이터셋에서 훈련된 자른 신경망은 동일한 희박성 조건을 가진 무작위 희박 네트워크보다 유의미하게 높은 모듈성을 보이며, 이는 약 99.7% 이상의 해당 무작위 네트워크를 초월한다.
  • 드롭아웃을 사용해 훈련한 MLP는 드롭아웃 없이 훈련한 경우보다 훨씬 높은 모듈성을 보이며, 이는 드롭아웃이 모듈성 가중치 구조를 촉진함을 시사한다.
  • 정확도 향상이 이루어지는 동안 모듈성이 증가하지만, 랜덤 레이블로 훈련할 경우 모듈성이 낮게 유지되며, 이는 모듈성이 실제 학습과 관련이 있음을 시사한다.
  • 일부 모듈은 기능적으로 중요하며, 손상 시 상당한 정확도 감소가 발생한다(예: 일부 사례에서 최대 16.6%p 감소)하며, 이러한 영향은 종종 통계적으로 유의미하다.
  • 일부 모듈은 강한 조건부 의존성을 보이며, 다른 모듈이 활성화되어 있을 때 한 모듈을 손상시키면 성능 저하가 더 심각하게 발생함을 보여, 상호의존성을 시사한다.
  • 모듈 간 의존성 구조는 비대칭적이고 비단순하며, 일부 모듈은 다른 모듈이 존재할 때에만 핵심적인 역할을 하며, 이는 기능적 특수화를 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.