Skip to main content
QUICK REVIEW

[논문 리뷰] Does Dirichlet Prior Smoothing Solve the Shannon Entropy Estimation Problem?

Yanjun Han, Jiantao Jiao|arXiv (Cornell University)|2015. 02. 01.
Statistical Methods and Inference참고 문헌 81인용 수 4
한 줄 요약

이 논문은 이산 분포의 샤논 엔트로피 및 푸워 합 기능에 대한 최대우도추정량(MLE)의 비점근적 분석을 제공하며, 고차원 설정에서 MLE가 엄격히 최적보다 열 劣하다는 것을 보여준다. MLE 성능을 향상시키기 위해 딜레트 포리어 스무딩이 효과가 없으며, 최적의 매개수 조정을 해도 최소최대 최적 속도를 달성할 수 없다는 것을 증명한다.

ABSTRACT

The Dirichlet prior is widely used in estimating discrete distributions and functionals of discrete distributions. In terms of Shannon entropy estimation, one approach is to plug-in the Dirichlet prior smoothed distribution into the entropy functional, while the other one is to calculate the Bayes estimator for entropy under the Dirichlet prior for squared error, which is the conditional expectation. We show that in general they do \emph{not} improve over the maximum likelihood estimator, which plugs-in the empirical distribution into the entropy functional. No matter how we tune the parameters in the Dirichlet prior, this approach cannot achieve the minimax rates in entropy estimation, as recently characterized by Jiao, Venkat, Han, and Weissman, and Wu and Yang. The performance of the minimax rate-optimal estimator with $n$ samples is essentially \emph{at least} as good as that of the Dirichlet smoothed entropy estimators with $n\ln n$ samples. We harness the theory of approximation using positive linear operators for analyzing the bias of plug-in estimators for general functionals under arbitrary statistical models, thereby further consolidating the interplay between these two fields, which was thoroughly developed and exploited by Jiao, Venkat, Han, and Weissman. We establish new results in approximation theory, and apply them to analyze the bias of the Dirichlet prior smoothed plug-in entropy estimator. This interplay between bias analysis and approximation theory is of relevance and consequence far beyond the specific problem setting in this paper.

연구 동기 및 목표

  • 고차원 이산 분포에서 샤논 엔트로피 및 푸워 합 기능을 추정할 때 MLE의 최악의 제곱오차 위험을 엄밀히 분석하는 것.
  • 엔트로피 및 푸워 합을 추정할 때 MLE의 일致성에 필요한 표본 복잡도를 규명하며, 특히 알파벳 크기 S가 클 경우에 대해 분석하는 것.
  • 딜레트 사전 스무딩 기법이 엔트로피 추정에서 최소최대 최적 속도를 달성할 수 있는지 평가하는 것.
  • 근사 이론과 농도 불등식을 사용하여 MLE 및 딜레트 기반 추정량의 기본 한계를 최소최대 속도 최적 추정량과 비교함으로써 설정하는 것.

제안 방법

  • MLE의 기대값 주변 분산을 제한하기 위해 농도 불등식을 사용하여 랜덤 변동을 정량화하는 것.
  • 양의 선형 연산자를 통해 근사 이론을 적용하여 MLE의 편향을 분석하는 것, 즉 기대값이 진짜 기능값으로부터 얼마나 떨어져 있는지 분석하는 것.
  • 샤논 엔트로피 및 푸워 합 기능에 대해 최악의 제곱오차 위험에 대한 비점근적 상한 및 하한을 유도하는 것.
  • 적분 잔여항을 포함한 테일러 전개를 사용하여 기능 추정량의 이阶 모멘트를 제한함으로써 정밀한 위험 정량화를 가능하게 하는 것.
  • 제곱오차 손실 하에서 플러그인 추정량과 베이즈 추정량을 비교하여 딜레트 사전 스무딩된 추정량의 성능을 분석하는 것.
  • 예를 들어 레마 26를 통해 제시된 지수 尾 꼬리 경계를 사용하여 고차원 모멘트 추정에서 희귀 사건의 이탈을 제어하는 것.

실험 결과

연구 질문

  • RQ1샤논 엔트로피를 추정할 때 MLE의 정확한 최악의 제곱오차 위험은 무엇이며, 표본 크기 n과 알파벳 크기 S에 따라 어떻게 척도화되는가?
  • RQ2MLE가 샤논 엔트로피 추정에서 일치하기 위해 필요한 표본 크기 n은 얼마이며, 이는 S에 어떻게 의존하는가?
  • RQ3딜레트 사전 스무딩이 엔트로피 추정에서 MLE 성능을 향상시킬 수 있으며, 최소최대 최적 속도를 달성할 수 있는가?
  • RQ40 < α < 1일 때, 푸워 합 기능을 추정할 경우 MLE의 수렴 속도는 최소최대 최적 속도와 어떻게 비교되는가?
  • RQ5MLE가 최소최대 최적 속도를 달성하는 조건은 무엇이며, 언제 엄격히 최적보다 열 劣한가?

주요 결과

  • 샤논 엔트로피에 대한 MLE는 n ≫ S일 때에만 일치하며, 최악의 제곱오차 위험은 보편적 상수까지 정확하게 타이트하다.
  • 0 < α < 1인 푸워 합 기능에 대해서는 MLE는 n ≫ S^{1/α}일 때에만 일치하며, 최소최대 속도에 비해 엄격히 열 劣하다.
  • 엔트로피에 대한 최소최대 속도 최적 추정량은 S / ln S개의 표본만 필요로 하지만, MLE는 n ≫ S가 필요하므로 표본 복잡도에 근본적인 격차가 존재한다.
  • 1 < α < 3/2일 때, MLE의 최악의 제곱오차 속도는 n^{-2(α-1)}이며, 최소최대 속도는 (n ln n)^{-2(α-1)}이므로 로그 격차가 존재한다.
  • α ≥ 3/2일 때, MLE는 알파벳 크기에 관계없이 항상 최소최대 최적 속도 n^{-1}을 달성하므로 이 영역에서는 최적이다.
  • 딜레트 사전 스무딩은 플러그인 또는 베이즈 추정 방식을 가리키지 않으며, 최소최대 속도를 달성할 수 없다. n개 표본을 사용한 최소최대 추정량의 성능은 n ln n개 표본을 사용한 딜레트 추정량의 성능보다 항상 뛰어나다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.