Skip to main content
QUICK REVIEW

[논문 리뷰] A Measure of the Complexity of Neural Representations based on Partial Information Decomposition

David A. Ehrlich, Andreas C. Schneider|arXiv (Cornell University)|2022. 09. 21.
Neural Networks and Applications인용 수 12
한 줄 요약

이 논문은 신경망에서 다수의 뉴런에 분산된 작업 관련 정보에 접근하는 데 드는 어려움을 측정하는 정보이론적 신규 측정법인 표현 복잡도를 도입한다. 이 방법은 중복, 고유, 상호작용 정보 기여도를 분리하여 분석하며, 양자화된 MNIST 및 CIFAR10 네트워크에서 계층 간 및 학습 과정에서 표현 복잡도가 감소하는 것을 보여주어 신경망 표현 구조 분석을 위한 원리적이고 해석 가능한 도구를 제공한다.

ABSTRACT

In neural networks, task-relevant information is represented jointly by groups of neurons. However, the specific way in which this mutual information about the classification label is distributed among the individual neurons is not well understood: While parts of it may only be obtainable from specific single neurons, other parts are carried redundantly or synergistically by multiple neurons. We show how Partial Information Decomposition (PID), a recent extension of information theory, can disentangle these different contributions. From this, we introduce the measure of "Representational Complexity", which quantifies the difficulty of accessing information spread across multiple neurons. We show how this complexity is directly computable for smaller layers. For larger layers, we propose subsampling and coarse-graining procedures and prove corresponding bounds on the latter. Empirically, for quantized deep neural networks solving the MNIST and CIFAR10 tasks, we observe that representational complexity decreases both through successive hidden layers and over training, and compare the results to related measures. Overall, we propose representational complexity as a principled and interpretable summary statistic for analyzing the structure and evolution of neural representations and complex systems in general.

연구 동기 및 목표

  • 딥 신경망에서 분류 레이블에 관한 정보가 뉴런 간에 어떻게 분포되어 있는지를 정량화하는 데 있어 원리적이고 해석 가능한 측정법의 부족을 해결하기 위해.
  • 부분 정보 분해(Partial Information Decomposition, PID)를 사용하여 뉴런 활동의 중복, 고유, 상호작용 기여도를 분리하여 작업 관련 정보에 기여하는 방법을 개발하기 위해.
  • 정보를 접근하기 위해 필요한 평균 뉴런 수를 캡처하는 계산 가능하고 해석 가능한 측정법인 표현 복잡도를 제안하기 위해.
  • 이론적 경계를 제공하는 표본 추출 및 군집화 절차를 통해 대규모 신경망 분석을 가능하게 하기 위해.
  • 표현 복잡도가 학습 과정과 계층 간에 신경 표현의 변화를 추적하는 데 유용한가를 보여주기 위해.

제안 방법

  • 분류 레이블과 뉴런 활성화 간의 상관정보를 비중복 원소인 고유, 중복, 상호작용 기여도로 분해하기 위해 부분 정보 분해(Partial Information Decomposition, PID)를 사용한다.
  • 표현 복잡도를 정의하며, 이는 PID 원소와 그들의 상호작용 수준에서 유도된 정보 접근을 위해 필요한 평균 뉴런 수이다.
  • 표본 추출 및 군집화 기법을 적용하여 더 큰 네트워크 계층에 대한 방법의 적용 범위를 확장하며, 군집화 절차에 대해 이론적 경계를 증명한다.
  • 상호작용 기반 PID에 대해 이론적으로 타당하고 측도 이론적으로 잘 정의된 추정기법을 사용하여, 양자화된 네트워크에의 적용을 가능하게 한다.
  • 양자화된 가중치를 가진 MNIST 및 CIFAR10 모델에서 결과를 계산하고 재현하기 위해 nninfo 파이썬 패키지를 사용한다.
  • 전체 표현 복잡도와 클래스별로 변화하는 복잡도를 분석함으로써 표현 역학의 세밀한 해석을 가능하게 한다.

실험 결과

연구 질문

  • RQ1딥 신경망에서 분류 레이블에 관한 작업 관련 정보는 뉴런 간에 어떻게 분포되어 있는가—특히 그 비율이 중복, 고유, 상호작용 기여도로 나뉘는가?
  • RQ2주어진 정보를 접근하기 위해 필요한 평균 뉴런 수는 얼마이며, 이는 계층 간 및 학습 과정에서 어떻게 변화하는가?
  • RQ3대규모 신경망 계층에 대해 표현 복잡도를 효율적으로 계산할 수 있으며, 표본 추출 및 군집화와 같은 근사 방법에 대해 이론적 보장은 무엇인가?
  • RQ4기존의 신경망 표현 구조 측정법과 비교했을 때 표현 복잡도는 어떻게 다른가?
  • RQ5일부 클래스는 더 높거나 낮은 표현 복잡도를 보이며, 학습 과정에서 이 복잡도의 변화 속도는 클래스 간으로 다를까?

주요 결과

  • 양자화된 MNIST 및 CIFAR10 네트워크에서 표현 복잡도는 연속적인 은닉 계층을 거치며 감소하며, 점점 더 효율적인 정보 접근을 의미한다.
  • 학습 과정에서 표현 복잡도가 감소함에 따라, 네트워크가 작업 관련 정보의 더 효율적이고 낮은 복잡도의 표현으로 진화하는 것으로 나타났다.
  • 제안된 표본 추출 및 군집화 절차는 이론적 경계가 보장된 신뢰할 수 있는 표현 복잡도 근사치를 제공하며, 대규모 네트워크에의 적용을 가능하게 한다.
  • 이 방법은 정보가 고유, 중복, 상호작용 기여도의 조합으로 뉴런에 분포되어 있음을 드러내며, 특히 복잡한 표현에서 상호작용이 핵심 역할을 한다.
  • 표현 복잡도는 클래스별로 계산 가능하여 일부 클래스는 다른 클래스보다 더 높은 복잡도로 표현되며, 학습 과정에서의 복잡도 감소가 클래스 간으로 균일하지 않음을 보여준다.
  • 측정법은 정보 이론에 기반하여 해석 가능하며, 신경망 분석에서 경험적 스파arsity나 복잡도 측정법에 대한 보다 원리적인 대안을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.