Skip to main content
QUICK REVIEW

[논문 리뷰] Distribution of Mutual Information

Marcus Hütter|ArXiv.org|2001. 12. 15.
Bayesian Modeling and Causal Inference참고 문헌 7인용 수 22
한 줄 요약

이 논문은 유한 표본에서 상호정보량 추정치의 신뢰도를 정량화하기 위해, 디리클레 사전을 사용하여 상호정보량 분포의 평균, 분산, 왜도, 체르스터를 분석적으로 근사한다. 평균에 대한 정확한 표현과 고차수 모멘트에 대한 정확한 점근적 전개를 제공함으로써, 유한 표본에서 상호정보량 추정치의 신뢰도를 신뢰성 있게 평가할 수 있다.

ABSTRACT

The mutual information of two random variables i and j with joint probabilities t_ij is commonly used in learning Bayesian nets as well as in many other fields. The chances t_ij are usually estimated by the empirical sampling frequency n_ij/n leading to a point estimate I(n_ij/n) for the mutual information. To answer questions like "is I(n_ij/n) consistent with zero?" or "what is the probability that the true mutual information is much larger than the point estimate?" one has to go beyond the point estimate. In the Bayesian framework one can answer these questions by utilizing a (second order) prior distribution p(t) comprising prior information about t. From the prior p(t) one can compute the posterior p(t|n), from which the distribution p(I|n) of the mutual information can be calculated. We derive reliable and quickly computable approximations for p(I|n). We concentrate on the mean, variance, skewness, and kurtosis, and non-informative priors. For the mean we also give an exact expression. Numerical issues and the range of validity are discussed.

연구 동기 및 목표

  • 유한 표본에서 상호정보량의 점추정치에 대한 불확실성 정량화의 부족을 해결하기 위해.
  • 점추정치 $ I(\hat{\pi}) $를 초월하여 상호정보량의 전체 사후분포 $ p(I|\mathbf{n}) $를 계산하기 위한 베이지안 프레임워크를 제공하기 위해.
  • 비정보성 있는 디리클레 사전 하에서 $ p(I|\mathbf{n}) $의 평균, 분산, 왜도, 체르스터에 대한 신뢰성 있고 신속하게 계산 가능한 분석적 표현을 유도하기 위해.
  • 이전의 히우리스틱 수치 방법이 상호정보량 분포에 대해 정확하지 않다는 점을 수정하기 위해, 특히 [KJ96, Kle99]에서의 오류를 수정하기 위해.
  • 베이지안 네트워크의 구조 학습에 핵심적인 역할을 하는 확률적 추론, 예를 들어 $ p(I > I_*|\mathbf{n}) $ 계산을 가능하게 하기 위해.

제안 방법

  • 공통 확률 $ \pi_{ij} $ 에 대한 두 번째 차수 사전 $ p(\boldsymbol{\pi}) $ 를 사용하여, 다항분포로 분포하는 카운트 $ \mathbf{n} $ 에 대해 디리클레 사후분포 $ p(\boldsymbol{\pi}|\mathbf{n}) \propto \prod_{ij} \pi_{ij}^{n_{ij}} $ 를 도출한다.
  • 후행 모멘트를 기반으로 디그라임 함수 $ \psi $ 를 사용하여 기대 상호정보량 $ E[I] $ 의 정확한 표현을 도출한다.
  • 일차 델타 방법과 고차수 촐레르트 전개를 적용하여 분산 $ \text{Var}[I] $ 와 고차수 중심모멘트(왜도, 체르스터)를 $ n^{-1} $ 의 거듭제곱으로 근사한다.
  • 고차수 모멘트를 $ O(n^{-3}) $ 까지의 $ E[I^k] $ 전개를 사용하여 계산하며, 이는 $ n_{ij}/n $, 로그우도비, 변량 항목의 합을 포함한다.
  • 피어슨 형식의 가정을 통한 개선된 분포 근사: $ p(I|\mathbf{n}) \propto (1 + \tilde{b}I + \tilde{c}I^2) \cdot p_0(I|\tilde{\mu}, \tilde{\sigma}^2) $ 를 평균, 분산, 왜도, 체르스터에 맞추어 설정한다.
  • 몬테카를로 시뮬레이션을 사용하여 근사치를 수치적으로 검증하였으며, 상대 오차가 $ (rs/n)^{1\ldots2} $ 수준임을 확인하였고, 평균은 정확하고 분산의 정확도가 향상됨을 입증하였다.

실험 결과

연구 질문

  • RQ1유한 표본 데이터로부터 상호정보량의 전체 사후분포 $ p(I|\mathbf{n}) $ 는 어떻게 신뢰성 있게 근사할 수 있는가?
  • RQ2디리클레 사전 하에서 상호정보량 분포의 평균, 분산, 왜도, 체르스터에 대한 정확한 표현과 점근적 표현은 무엇인가?
  • RQ3$ p(I|\mathbf{n}) $ 의 고차수 모멘트는 정규분포에서 얼마나 벗어나며, 이를 통해 분포 근사치를 개선할 수 있는가?
  • RQ4이전의 히우리스틱 수치 방법, 예를 들어 [KJ96, Kle99]에서 제시한 방법들이 왜 잘못되었으며, 어떻게 수정할 수 있는가?
  • RQ5유도된 분석적 근사치의 유효 범위와 수치 정확도는 소형에서 중간 크기의 표본 크기에서 어떻게 되는가?

주요 결과

  • 기대 상호정보량의 정확한 표현은 $ E[I] = \sum_{ij} \left( \psi(n_{ij} + 1) - \psi(n_{ij} + 1) \right) $ 이며, 디그라임 함수를 사용한 후행 기대값에서 도출된다.
  • 상호정보량의 분산은 $ \text{Var}[I] = \frac{1}{n} \left( K - J^2 \right) + O(n^{-2}) $ 로 근사되며, 여기서 $ K $ 와 $ J $ 는 로그우도비의 합이다.
  • 왜도는 $ n^{-1/2} $ 의 주기이며, 체르스터는 $ O(n^{-1}) $ 보정을 통해 점점 정규분포의 3에 수렴하며, 이는 작은 $ n $ 에서 비정규성을 나타낸다.
  • 고차수 모멘트는 $ O(n^{-3}) $ 까지 유도되었으며, $ E[(I - E[I])^3] $ 와 $ E[(I - E[I])^4] $ 의 표현은 $ J, K, L, M, Q, P $ 를 포함하여 개선된 분포 적합을 가능하게 한다.
  • 분산의 근사 오차는 $ \imath $ 와 $ \jmath $ 가 종속일 경우 $ (rs/n)^2 $ 수준이며, 독립일 경우 $ O(rs/n) $ 수준이며, 몬테카를로 검증을 통해 이 범위 내에서 정확도가 확인되었다.
  • 이전의 히우리스틱 접근법 [KJ96, Kle99] 는 분석적으로 잘못되었으며, $ n^{-1} $ 에 대한 체계적 전개를 제공함으로써 이를 수정하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.