Skip to main content
QUICK REVIEW

[论文解读] Multiple Testing in Nonparametric Hidden Markov Models: An Empirical Bayes Approach

Kweku Abraham, Ismaël Castillo|arXiv (Cornell University)|Jan 11, 2021
Bayesian Methods and Mixture Models参考文献 36被引用 9
一句话总结

本文提出了一种经验贝叶斯方法,用于非参数隐马尔可夫模型(HMM)中的多重检验,通过数据驱动的后验概率(ℓ-值)阈值化来控制错误发现率(FDR)并最大化真正发现率(TDR)。该方法建立了理论保证,证明其可实现目标FDR并达到最优TDR,其基础是发射密度的上确界范数估计器,该估计器以极小化最优速率收敛。

ABSTRACT

Given a nonparametric Hidden Markov Model (HMM) with two states, the question of constructing efficient multiple testing procedures is considered, treating one of the states as an unknown null hypothesis. A procedure is introduced, based on nonparametric empirical Bayes ideas, that controls the False Discovery Rate (FDR) at a user--specified level. Guarantees on power are also provided, in the form of a control of the true positive rate. One of the key steps in the construction requires supremum--norm convergence of preliminary estimators of the emission densities of the HMM. We provide the existence of such estimators, with convergence at the optimal minimax rate, for the case of a HMM with $J\ge 2$ states, which is of independent interest.

研究动机与目标

  • 开发一种用于非参数HMM的经 验贝叶斯多重检验程序,使错误发现率(FDR)控制在用户指定的水平。
  • 在FDR控制下通过最大化真正发现率(TDR)来确保高统计功效。
  • 建立当模型参数被估计而非已知时,FDR与TDR控制的理论保证。
  • 构建非参数HMM中发射密度的上确界范数估计器,并实现最优收敛速率,且独立于多重检验框架。
  • 证明参数化建模假设可能严重损害FDR与TDR性能,从而证明非参数估计的必要性。

提出的方法

  • 该方法使用ℓ-值作为多重检验的检验统计量,ℓ-值定义为每个状态为零假设(θi = 0)的后验概率。
  • 选择一个数据依赖的阈值,使得在给定数据条件下,期望FDR近似等于目标水平t,遵循Müller等人(2004)和Sun & Cai(2009)的方法。
  • 通过基于矩的方法构建发射密度的上确界范数估计器,涉及矩矩阵M^x、P、O和V的经验版本,结合特征值分解与条件数控制进行正则化。
  • 该过程依赖一组观测函数(h1,…,hL₀),以确保密度基的线性无关性,并实现矩矩阵的稳定求逆。
  • 估计器通过基于核的平滑(KL)与矩阵求逆技术构建,并在算子范数下给出估计误差的理论界。
  • 通过将发射密度估计器的上确界范数收敛误差界传播至ℓ-值阈值化程序,推导出FDR与TDR的理论控制。

实验结果

研究问题

  • RQ1在模型参数被估计而非已知的情况下,非参数HMM设置下的经验贝叶斯多重检验程序能否实现错误发现率(FDR)的渐近控制?
  • RQ2所提出的方法在FDR控制下是否能保持最优功效,即真正发现率(TDR)最优?
  • RQ3对于具有J ≥ 2个状态的非参数HMM,发射密度的上确界范数估计的最优收敛速率是什么?
  • RQ4估计范数的选择(上确界范数与L²范数)如何影响经验贝叶斯多重检验程序的性能?
  • RQ5在参数化HMM中模型误设在多大程度上会损害FDR与TDR控制?非参数估计能否缓解这一问题?

主要发现

  • 所提出的经 验贝叶斯程序在用户指定水平t下控制了错误发现率(FDR),在温和正则性条件下实现了渐近FDR收敛至t。
  • 该方法在FDR控制下实现了最优真正发现率(TDR),表明该程序在多重检验意义上是渐近最优的。
  • 非参数HMM中发射密度的上确界范数估计器,对离散观测实现参数速率N⁻¹/²,对具有正则性s的Hölder光滑密度实现极小化最优速率(N/log N)⁻ˢ/(²ˢ⁺¹)。
  • 非参数HMM中上确界范数估计的极小化最优速率被确立为最优,与经典i.i.d.密度估计中的已知下界一致。
  • 理论框架表明,上确界范数中的估计误差会传播至ℓ-值误差控制,从而实现FDR与TDR的保证。
  • 该方法对未知零假设分布具有鲁棒性,而传统方法如Benjamini-Hochberg则需已知零假设分布;在模型误设下,该方法优于参数化替代方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。