Skip to main content
QUICK REVIEW

[논문 리뷰] Approximate Profile Maximum Likelihood

Dmitri S. Pavlichin, Jiantao Jiao|arXiv (Cornell University)|2017. 12. 19.
Bayesian Modeling and Causal Inference참고 문헌 29인용 수 12
한 줄 요약

이 논문은 근사 프로파일 최대우도(APML)를 위한 효율적인 동적 프ogramming 알고리즘을 제안한다. 이 알고리즘은 유사한 경험 빈도를 가진 기호들을 군집화하여 PML 계산에서 행렬 행렬식의 하한을 제공한다. 이 방법은 엔트로피, 레니 엔트로피, 지지 크기, 분산 함수형을 추정할 때 최신 기술 대비 뛰어난 경험적 성능을 달성하며, 선형 시간 복잡도를 가지며 튜닝 파rameter가 없다.

ABSTRACT

We propose an efficient algorithm for approximate computation of the profile maximum likelihood (PML), a variant of maximum likelihood maximizing the probability of observing a sufficient statistic rather than the empirical sample. The PML has appealing theoretical properties, but is difficult to compute exactly. Inspired by observations gleaned from exactly solvable cases, we look for an approximate PML solution, which, intuitively, clumps comparably frequent symbols into one symbol. This amounts to lower-bounding a certain matrix permanent by summing over a subgroup of the symmetric group rather than the whole group during the computation. We extensively experiment with the approximate solution, and find the empirical performance of our approach is competitive and sometimes significantly better than state-of-the-art performance for various estimation problems.

연구 동기 및 목표

  • 정확한 프로파일 최대우도(PML)의 계산 비가역성 문제를 다루며, 이는 행렬 행렬식 계산으로 인해 NP-난이도이기 때문이다.
  • 레벨 세트로 정렬된 기호들을 유사한 경험 빈도를 가진 기호들로 군집화하여 실용적이고 파rameter가 없는 PML의 근사치를 개발한다.
  • 최적의 샘플 복잡도를 달성할 수 있도록 엔트로피, 레니 엔트로피, L1 거리와 같은 함수형의 플러그인 추정을 가능하게 한다.
  • KL, 헬링거, χ² 분산과 같은 분산 함수형 추정을 위한 다차원 PML로 APML 프레임워크를 확장한다.
  • 특히 지지 크기가 알려지지 않은 설정에서 이산 및 연속 부분을 감지할 수 있는 확장 가능한 알고리즘을 제공한다.

제안 방법

  • 후보 분포의 레벨 세트를 유지하는 순열만을 고려하여 PML를 근사함으로써 하한 목적 함수를 도출한다.
  • APML 목적 함수를 KL 발산 항과 레벨 세트 크기의 팩토리얼 곱의 최대화로 공식화한다: $\bar{p}^* = \arg\max_p \left( e^{-nD(\hat{p}||p)} \prod_{\alpha \in A(p)} |\alpha|! \right)$.
  • 동적 프로그래밍을 사용하여 최적의 레벨 세트 분할을 계산하며, 최적의 지지 크기를 찾기 위해 미리 정의된 unseen 기호 수에 대한 이분 검색을 수행한다.
  • 각 빈도 그룹 $i$에 대해, $f(F_0, K_i, N_i) = \log\left(\frac{(K_i + F_0)!}{F_0!}\right) - N_i \log(K_i + F_0)$의 단조성 최적화를 통해 최적의 unseen 기호 수 $F_0^{(i)}$를 계산한다.
  • 레벨 세트의 수가 유한한 $F_0$에서 최대값이 도달하지 않음을 인식함으로써, 분포에 연속 부분이 존재하는 경우를 감지하고(특히 $F_1 > 1$ 이고 $i=1$ 일 때), 이는 이산 부분과 별도로 처리한다.
  • 계산 복잡도 증가로 인해 더 높은 복잡도를 가지므로, 이중 수의 분할을 사용하여 다차원 PML로 방법을 확장하고, 히وري스틱 기반의 근사 알고리즘을 적용한다.

실험 결과

연구 질문

  • RQ1정확한 PML 계산의 지수적 비용을 피하면서도 계산적으로 효율적인 PML 근사치를 설계할 수 있는가?
  • RQ2유사한 경험 빈도를 가진 기호들을 레벨 세트로 군집화하는 것이 실용적이고 정확한 PML 근사치를 제공하는가?
  • RQ3APML 추정기는 엔트로피 및 지지 크기와 같은 함수형 추정에서 최적의 샘플 복잡도를 달성할 수 있는가?
  • RQ4지지 크기가 알려지지 않은 설정에서 PML 분포에 연속 성분이 존재하는 경우를 어떻게 감지하고 처리할 수 있는가?
  • RQ5이론적 보장이 있는 다차원 PML를 위한 APML 프레임워크를 확장할 수 있는가?

주요 결과

  • 제안된 APML 알고리즘은 지지 크기 최적화에 대해 $O(\sqrt{n} \log n)$ 시간 복잡도를 가지며, 큰 샘플에 대해서도 확장 가능하다.
  • APML 추정기는 엔트로피, 레니 엔트로피, 균일성으로부터의 L1 거리 추정에서 최신 기술 대비 경쟁력 있거나 뛰어난 경험적 성능을 달성한다.
  • 특히 $i=1$ 이고 $F_1 > 1$ 인 경우, $F_0$에 대한 최대값이 어떤 유한한 $F_0$에서도 도달하지 않으며, 이는 근사 PML 분포에 질량 $N_1/n$의 연속 부분이 존재함을 시사한다.
  • 만약 $N_i \geq K_i H_{K_i}$ 이면, 최적의 $F_0^{(i)} = 0$이며, 이는 해당 빈도 그룹에 추가로 unseen 기호가 필요하지 않음을 의미한다.
  • $f(F_0, K_i, N_i)$ 함수는 $F_0$에 대해 단조성을 가지며, 이는 $O(\log n)$ 시간 내에 각 그룹에 대해 최적의 $F_0^{(i)}$를 찾는 데에 효율적인 이분 검색이 가능함을 의미한다.
  • 다차원 경우에서 APML 접근법은 KL, 헬링거, $\chi^2$ 분산 함수형의 최적 샘플 복잡도를 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.