Skip to main content
QUICK REVIEW

[논문 리뷰] Estimation of KL Divergence: Optimal Minimax Rate

Yuheng Bu, Shaofeng Zou|arXiv (Cornell University)|2016. 07. 09.
Machine Learning and Algorithms참고 문헌 25인용 수 9
한 줄 요약

이 논문은 증가하는 알파벳 크기 $k$를 가진 두 이산 분포 간의 Kullback-Leibler (KL) 발산을 추정할 때 최적의 최대위험률(minimax rate)을 확립한다. 보정된 플러그인 추정기(augmented plug-in estimator)를 제안하고, 일반화된 Le Cam의 방법과 다항식 근사법을 사용하여, 유한한 밀도 비율 $f(k)$ 조건 하에서 최대위험률의 제곱이 $\left(\frac{k}{m\log k} + \frac{kf(k)}{n\log k}\right)^2 + \frac{\log^2 f(k)}{m} + \frac{f(k)}{n}$ 의 상수 배 범위 내에 있음을 증명한다.

ABSTRACT

The problem of estimating the Kullback-Leibler divergence $D(P\|Q)$ between two unknown distributions $P$ and $Q$ is studied, under the assumption that the alphabet size $k$ of the distributions can scale to infinity. The estimation is based on $m$ independent samples drawn from $P$ and $n$ independent samples drawn from $Q$. It is first shown that there does not exist any consistent estimator that guarantees asymptotically small worst-case quadratic risk over the set of all pairs of distributions. A restricted set that contains pairs of distributions, with density ratio bounded by a function $f(k)$ is further considered. {An augmented plug-in estimator is proposed, and its worst-case quadratic risk is shown to be within a constant factor of $(\frac{k}{m}+\frac{kf(k)}{n})^2+\frac{\log ^2 f(k)}{m}+\frac{f(k)}{n}$, if $m$ and $n$ exceed a constant factor of $k$ and $kf(k)$, respectively.} Moreover, the minimax quadratic risk is characterized to be within a constant factor of $(\frac{k}{m\log k}+\frac{kf(k)}{n\log k})^2+\frac{\log ^2 f(k)}{m}+\frac{f(k)}{n}$, if $m$ and $n$ exceed a constant factor of $k/\log(k)$ and $kf(k)/\log k$, respectively. The lower bound on the minimax quadratic risk is characterized by employing a generalized Le Cam's method. A minimax optimal estimator is then constructed by employing both the polynomial approximation and the plug-in approaches.

연구 동기 및 목표

  • 알파벳 크기 $k$가 무한대에 가까워질 때 두 이산 분포 간 KL 발산 추정의 최적 최대위험률을 규명하는 것.
  • 밀도 비율이 유계가 아니므로 전체 분포 쌍에 대해 일致한 추정기가 존재하지 않는다는 도전 과제를 다루는 것.
  • 일致한 추정과 최대위험률 규명이 가능하도록 밀도 비율 $f(k)$ 가 유계인 쌍으로 문제를 제한하는 것.
  • 일반화된 Le Cam의 방법과 다항식 근사법을 사용하여 최대위험률의 날카운 상한 및 하한을 도출하는 것.
  • 플러그인 추정과 다항식 근사 기법을 조합하여 최대위험률 최적의 추정기를 구성하는 것.

제안 방법

  • 플러그인 방법을 개선하기 위해 다항식 근사에 의한 편향 보정을 통합한 보정된 플러그인 추정기를 제안한다.
  • 지역 점근 정규성과 검정 기반의 분석을 활용하여 일반화된 Le Cam의 방법을 적용해 최대위험률의 하한을 유도한다.
  • 특히 확률이 작은 영역에서 $\log(P_i/Q_i)$ 함수의 추정에서 편향을 제어하기 위해 다항식 근사를 사용한다.
  • 밀도 비율 $P_i/Q_i \leq f(k)$ 를 만족하는 제한된 집합 $\mathcal{M}_{k,f(k)}$ 에서 최악의 제곱 위험도를 분석하여 유계성과 일관성을 확보한다.
  • 추정 오차를 편향과 분산 성분으로 분해하고, 농도 불등식을 통해 꼬리 사건을 신중히 다루어 위험도 한계를 유도한다.
  • 표본 복잡도 조건 하에서 최대위험률가 $\left(\frac{k}{m\log k} + \frac{kf(k)}{n\log k}\right)^2 + \frac{\log^2 f(k)}{m} + \frac{f(k)}{n}$ 의 상수 배 범위 내에서 스케일링됨을 입증한다.

실험 결과

연구 질문

  • RQ1알파벳 크기 $k$가 무한대에 가까워질 때 KL 발산 추정의 본질적 한계(minimax rate)는 무엇인가?
  • RQ2 growing $k$ 조건 하에서 전체 분포 쌍 $\mathcal{M}_k$ 에 대해 일치한 추정기가 존재할 수 있는가?
  • RQ3유계 밀도 비율 $f(k)$ 는 KL 발산 추정의 최대위험률에 어떤 영향을 미치는가?
  • RQ4추정 위험도를 최소화하기 위해 $P$ 와 $Q$ 에서의 표본 크기 $m$ 과 $n$ 사이의 최적의 트레이드오프는 무엇인가?
  • RQ5유도된 하한에 도달하는 최대위험률 최적의 추정기를 구성할 수 있는가?

주요 결과

  • $k \to \infty$ 일 때 밀도 비율이 무한대가 되므로 전체 집합 $\mathcal{M}_k$ 에서 일치한 추정기는 존재하지 않는다.
  • 유계 밀도 비율 $f(k)$ 를 가진 제한된 집합 $\mathcal{M}_{k,f(k)}$ 에서 최대위험률의 제곱은 상수 배 범위 내에서 $\asymp \left(\frac{k}{m\log k} + \frac{kf(k)}{n\log k}\right)^2 + \frac{\log^2 f(k)}{m} + \frac{f(k)}{n}$ 으로 특징지어진다.
  • 제안된 보정된 플러그인 추정기는 $m \gtrsim k$ 및 $n \gtrsim kf(k)$ 를 만족할 경우, 최악의 제곱 위험도가 $\left(\frac{k}{m} + \frac{kf(k)}{n}\right)^2 + \frac{\log^2 f(k)}{m} + \frac{f(k)}{n}$ 의 상수 배 범위 내에 있음을 달성한다.
  • 최대위험률의 하한은 두 지역 분포를 구성하고 그 가려내기 능력을 분석하는 일반화된 Le Cam의 방법을 통해 도출된다.
  • 최대위험률 최적의 추정기는 로그 함수의 다항식 근사와 플러그인 추정을 조합하여 편향 제어를 보장한다.
  • 분석 결과, 위험도 항목의 분모에 있는 $\log k$ 요소는 희박한 표본 추출 조건 하에서 고차원 설정에서 분산을 제어해야 한다는 필요성에서 기인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.