Skip to main content
QUICK REVIEW

[논문 리뷰] Adaptive Estimation of Shannon Entropy

Yanjun Han, Jiantao Jiao|arXiv (Cornell University)|2015. 02. 01.
Control Systems and Identification참고 문헌 30인용 수 10
한 줄 요약

이 논문은 지지집합 크기나 엔트로피 수준을 알지 못하더라도 중첩된 분포 클래스 전반에서 최소최대 최적의 $L_2$ 위험을 달성하는 샤논 엔트로피에 대한 적응형 추정기의 도입을 제안한다. 근사 이론과 최적 다항근사의 활용을 통해 이 추정기는 $n\ln n$ 개의 표본을 가진 최대우도추정기(MLE)와 동등한 성능을 보이며, 모든 엔트로피 영역에서 일반적인 효과적 표본 크기 증가 현상을 입증한다.

ABSTRACT

We consider estimating the Shannon entropy of a discrete distribution $P$ from $n$ i.i.d. samples. Recently, Jiao, Venkat, Han, and Weissman, and Wu and Yang constructed approximation theoretic estimators that achieve the minimax $L_2$ rates in estimating entropy. Their estimators are consistent given $n \gg \frac{S}{\ln S}$ samples, where $S$ is the alphabet size, and it is the best possible sample complexity. In contrast, the Maximum Likelihood Estimator (MLE), which is the empirical entropy, requires $n\gg S$ samples. In the present paper we significantly refine the minimax results of existing work. To alleviate the pessimism of minimaxity, we adopt the adaptive estimation framework, and show that the minimax rate-optimal estimator in Jiao, Venkat, Han, and Weissman achieves the minimax rates simultaneously over a nested sequence of subsets of distributions $P$, without knowing the alphabet size $S$ or which subset $P$ lies in. In other words, their estimator is adaptive with respect to this nested sequence of the parameter space, which is characterized by the entropy of the distribution. We also characterize the maximum risk of the MLE over this nested sequence, and show, for every subset in the sequence, that the performance of the minimax rate-optimal estimator with $n$ samples is essentially that of the MLE with $n\ln n$ samples, thereby further substantiating the generality of the phenomenon identified by Jiao, Venkat, Han, and Weissman.

연구 동기 및 목표

  • 지지집합 크기 $S$ 또는 엔트로피 수준을 사전에 알지 못하더라도 최소최대 최적의 $L_2$ 위험을 달성하는 샤논 엔트로피 추정기의 개발.
  • Jiao 등(2015)의 추정기가 엔트로피로 매개변수화된 중첩된 분포 클래스 전반에서 동시에 최소최대 최적임을 보여줌으로써 기존 최소최대 결과의 정교화.
  • 다양한 엔트로피 영역에서 MLE와 최소최대 최적 추정기 간의 성능 격차 정량화.
  • 최소최대 추정기의 효과적 표본 크기 증가 현상을 체계적으로 입증하며, $n$ 개의 표본을 가진 최소최대 추정기가 $n\ln n$ 개의 표본을 가진 MLE와 동일한 성능을 내는 것을 보여줌.

제안 방법

  • 엔트로피로 매개변수화된 중첩된 분포 클래스 $\mathcal{M}_S(H)$ 전반에서 적응형 추정 프레임워크 채택.
  • $-x\ln x$ 함수의 $[0,1]$에서의 근사화를 기반으로, 다항근사의 최적화를 통해 최소최대 최적 추정기 구성.
  • Ditzian-Totik 모듈러스의 부드러움과 가중 노름을 통한 다항식 도함수 제어를 통해 근사 오차의 균일한 경계 확립.
  • 표본 크기의 尾행동을 포isson화 하여 농도 부등식을 사용해 편향과 분산으로 분해하여 추정기의 위험 분석.
  • 최소최대 추정기의 위험과 MLE의 위험 간 渐近 등가성에 기반해, $n$ 개의 표본을 가진 최소최대 추정기의 위험과 $n\ln n$ 개의 표본을 가진 MLE의 위험은 동일함을 활용.
  • 조정 파rameter 없이 모든 엔트로피 수준에서 동시에 최소최대 최적 추정률을 달성함을 보여 추정기가 적응형임을 증명.

실험 결과

연구 질문

  • RQ1지지집합 크기나 엔트로피를 알지 못하더라도 단일 엔트로피 추정기가 모든 엔트로피 수준에서 최소최대 최적의 $L_2$ 위험을 달성할 수 있는가?
  • RQ2최소최대 최적 추정기의 성능은 다양한 엔트로피 영역에서 MLE와 어떻게 비교되는가?
  • RQ3최소최대 추정기의 효과적 표본 크기 증가 폭은 MLE에 비해 어느 정도이며, 이 격차는 일반적인가?
  • RQ4근사 이론 기반 추정기는 엔트로피로 매개변수화된 중첩된 분포 클래스 가족 전반에서 적응형임을 입증할 수 있는가?
  • RQ5표본 수를 $n\ln n$ 으로 스케일링했을 때, 최소최대 추정기의 편향과 MLE의 편향 간 정확한 관계는 무엇인가?

주요 결과

  • Jiao 등(2015)의 최소최대 최적 추정기는 엔트로피로 매개변수화된 중첩된 분포 클래스 전반에서 적응형이며, $S$ 또는 $H$ 를 사전에 알지 못하더라도 최소최대 $L_2$ 위험을 달성한다.
  • 이 추정기의 $n$ 개의 표본에서의 성능은 MLE가 $n\ln n$ 개의 표본을 가졌을 때와 거의 동일하다. 이는 효과적 표본 크기 증가 현상을 확인한다.
  • 중첩된 분포 클래스 전반에서 MLE의 최대 $L_2$ 위험은 $\Theta\left(\frac{H^2}{n}\right)$ 로 증가하지만, 최소최대 추정기는 $\Theta\left(\frac{H^2}{n\ln n}\right)$ 를 달성하며, 이는 최소최대 하한선과 일치한다.
  • 다항식의 차수 $K$ 에 대해 $-x\ln x$ 의 최적 다항근사 오차는 $O(K^{-2})$ 로 유계이며, 다항식의 도함수는 0 근처에서 균일하게 제어된다.
  • 모든 엔트로피 수준에서 추정기의 위험은 균일하게 유계이며, 편향 항은 $\frac{H^2}{n\ln n}$ 으로 스케일링되며, 이는 $n$ 이 $n\ln n$ 으로 대체된 MLE의 편향과 일치한다.
  • 증명을 통해 추정기의 위험은 $O\left(\frac{H^2}{n\ln n}\right)$ 이며, 이 비율은 최소최대 최적임을 입증하여 표본 크기 증가의 일반성 확인.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.