Skip to main content
QUICK REVIEW

[논문 리뷰] Unbiased Estimators for Entropy and Class Number

Stephen Montgomery-Smith, Thomas Schürmann|arXiv (Cornell University)|2014. 10. 18.
Face and Expression Recognition참고 문헌 4인용 수 7
한 줄 요약

이 논문은 임의의 길이의 독립적 샘플링 환경에서 샤논 엔트로피와 클래스 수에 대한 새로운 비편향 추정량을 제안한다. 상호 재발 시간과 조화수를 기반으로 한 두 가지 엔트로피 추정량과, 모든 경우에서 정확한 확률적 유도를 통해 0의 편향을 달성하는 두 가지 비편향 클래스 수 추정량을 제안한다.

ABSTRACT

We introduce unbiased estimators for the Shannon entropy and the class number, in the situation that we are able to take sequences of independent samples of arbitrary length.

연구 동기 및 목표

  • 무한한 인구에서 알려진 클래스를 가진 상태에서 샤논 엔트로피에 대한 비편향 추정량을 개발하기 위해.
  • 기존의 엔트로피 추정량이 실제 엔트로피를 체계적으로 과소평가하는 잘 알려진 편향 문제를 해결하기 위해.
  • 생태학적 및 정보이론적 응용에서 중요한 클래스 수 $M$에 대한 비편향 추정량을 제안하기 위해.
  • 조합적 분석을 통해 이론적으로 타당한 추정량을 제공하여, 조합적 분석을 통해 편향이 0이 되도록 하되, 평균화 없이선 분산이 높을 수 있음을 고려하기 위해.
  • 실제 데이터 수집에 대응하기 위해 다중 시작점과 샘플 재정렬 기반 추정량을 제안하기 위해.

제안 방법

  • 첫 번째 추정량 $\hat{H}_1 = \sum_{i=1}^M \frac{I_{N_i \geq 2}}{N_i - 1}$을 제안하며, 여기서 $N_i$는 클래스 $C_i$로의 첫 번째 도착 시간이며, 기하분포 성질을 활용한다.
  • 두 번째 추정량 $\hat{H}_2 = h_{N-1}$을 도입하며, 여기서 $N$은 $w_1$과 $w_{k+1}$가 같은 클래스에 속하는 최소의 $k \geq 1$이며, 항등식 $\mathbb{E}[h_{N-1} \mid w_1 \in C_i] = -\log p_i$를 활용한다.
  • 분산을 향상시키기 위해 $n$개의 이러한 추정량을 평균화함: $\hat{H}_3 = \frac{1}{n} \sum_{j=1}^n h_{N^{(j)}-1}$, 여기서 $N^{(j)}$는 $w_j$와 $w_{k+j}$로부터 정의된다.
  • 클래스 수 $M$에 대한 비편향 추정량으로 $\hat{M}_1 = N$을 도입하며, 동일한 재발 시간 분포에서 유도된다.
  • 다중 시작점에 기반한 개선된 추정량으로 $\hat{M}_2 = \frac{1}{n} \sum_{j=1}^n N^{(j)}$을 제안한다.
  • 샘플 순서가 유지되지 않을 경우에 사용할 수 있도록 보정 기반 추정량 $\hat{M}_4 = \hat{M}_3 + \frac{1}{n} \sum_{i \in A} \left( \frac{m+1}{s_i+1} - \frac{n+1}{r_i+1} \right)$을 유도한다.

실험 결과

연구 질문

  • RQ1임의의 길이의 i.i.d. 샘플이 가용할 경우, 샤논 엔트로피에 대한 비편향 추정량을 구성할 수 있는가?
  • RQ2정확한 확률적 모델링을 통해 고전적 엔트로피 추정량의 잘 알려진 편향을 어떻게 제거할 수 있는가?
  • RQ3재발 시간을 활용하여 인구 내의 서로 다른 클래스 수 $M$에 대한 비편향 추정량을 구성할 수 있는가?
  • RQ4분산이 비편향 추정량의 실용적 사용성에 미치는 영향은 무엇이며, 이를 어떻게 완화할 수 있는가?
  • RQ5샘플 순서가 기록되지 않는 실세계 데이터 수집 환경에 비편향 추정량을 어떻게 적응시킬 수 있는가?

주요 결과

  • 추정량 $\hat{H}_1 = \sum_{i=1}^M \frac{I_{N_i \geq 2}}{N_i - 1}$은 엄격하게 비편향이며, $\mathbb{E}[\hat{H}_1] = -\sum_{i=1}^M p_i \log p_i$를 만족한다.
  • 추정량 $\hat{H}_2 = h_{N-1}$는 엔트로피에 대해 비편향이며, 항등식 $\mathbb{E}[h_{N-1} \mid w_1 \in C_i] = -\log p_i$로부터 유도되며, 총 기대값으로 $\mathbb{E}[\hat{H}_2] = H$가 된다.
  • 다중 추정량을 평균화함으로써 분산을 감소시킬 수 있으나, 추가 분석 없이선 신뢰구간이 넓어진다: $\hat{H}_3 = \frac{1}{n} \sum_{j=1}^n h_{N^{(j)}-1}$.
  • 추정량 $\hat{M}_1 = N$은 클래스 수 $M$에 대해 비편향이며, 여기서 $N$은 $w_1$이 자신의 클래스로 처음으로 복귀하는 시간이다.
  • 추정량 $\hat{M}_2 = \frac{1}{n} \sum_{j=1}^n N^{(j)}$는 다중 시작점에서 유도된 일관성 있고 비편향된 $M$의 추정치를 제공한다.
  • 보정 기반 추정량 $\hat{M}_4 = \hat{M}_3 + \frac{1}{n} \sum_{i \in A} \left( \frac{m+1}{s_i+1} - \frac{n+1}{r_i+1} \right)$는 샘플 순서가 유지되지 않을 경우에도 비편향 추정이 가능하도록 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.