Skip to main content
QUICK REVIEW

[论文解读] Bayesian Conditional Tensor Factorizations for High-Dimensional Classification

Yun Yang, David B. Dunson|arXiv (Cornell University)|Jan 21, 2013
Tensor decomposition and applications参考文献 20被引用 13
一句话总结

本文提出了一种用于高维分类的贝叶斯条件张量分解模型,该模型能够灵活地非参数化建模复杂交互作用,同时实现自动变量选择。通过利用具有稀疏诱导先验的结构化Tucker分解,该方法在超高维设置下仍能实现接近参数化的后验收缩速率,并得到理论保证和MCMC计算的支持。

ABSTRACT

In many application areas, data are collected on a categorical response and high-dimensional categorical predictors, with the goals being to build a parsimonious model for classification while doing inferences on the important predictors. In settings such as genomics, there can be complex interactions among the predictors. By using a carefully-structured Tucker factorization, we define a model that can characterize any conditional probability, while facilitating variable selection and modeling of higher-order interactions. Following a Bayesian approach, we propose a Markov chain Monte Carlo algorithm for posterior computation accommodating uncertainty in the predictors to be included. Under near sparsity assumptions, the posterior distribution for the conditional probability is shown to achieve close to the parametric rate of contraction even in ultra high-dimensional settings. The methods are illustrated using simulation examples and biomedical applications.

研究动机与目标

  • 开发一种用于高维分类的非参数贝叶斯框架,以捕捉预测变量之间的复杂交互作用。
  • 通过在张量因子上引入稀疏诱导先验,实现自动变量选择。
  • 对变量选择和预测中的不确定性提供完整的概率表征。
  • 在近稀疏性假设下,理论上建立接近参数化速率的后验收缩速率。
  • 解决现有方法(如带惩罚的逻辑回归和随机森林)的局限性,特别是在超高维、低信噪比情形下的表现。

提出的方法

  • 该方法将条件概率 P(Y=y | X₁=x₁,…,Xₚ=xₚ) 建模为一个多元张量,采用具有非负因子的Tucker分解。
  • 在核心张量和因子矩阵上设置层次先验,对因子载荷使用 Dirichlet(1/d, ..., 1/d) 先验,以确保非负性和均匀性。
  • 通过在活跃预测变量集合上施加稀疏诱导先验实现变量选择,其中 γ 表示相关预测变量的子集。
  • 该模型采用贝叶斯方法,对张量分解参数建立联合先验,从而实现完整的不确定性量化。
  • 开发了一种定制的MCMC算法用于后验计算,能够处理预测变量及其交互作用包含与否的不确定性。
  • 理论分析基于构造 εₙ-网,并利用非参数贝叶斯框架验证后验收缩条件。

实验结果

研究问题

  • RQ1贝叶斯张量分解模型是否能在超高维分类设置下实现接近参数化的后验收缩速率?
  • RQ2如何灵活地建模分类预测变量之间的高阶交互作用,同时保持可解释性和稀疏性?
  • RQ3能否在非参数贝叶斯张量模型中有效执行高维分类数据的变量选择?
  • RQ4当真实模型近似低秩且稀疏时,能否为后验集中提供理论保证?
  • RQ5在高维、低信噪比场景下,该方法与标准惩罚逻辑回归和随机森林相比性能如何?

主要发现

  • 即使预测变量数量随样本量呈指数增长,条件概率的后部分布仍能实现接近参数化速率的收缩速率。
  • 在近稀疏性假设下,该方法对条件概率张量的后验收缩速率为 √(log pₙ / n) 阶,接近参数化速率。
  • 理论分析表明,先验对模型大小超过真实模型的模型赋予指数级小的概率,从而确保模型选择的一致性。
  • MCMC算法成功探索了高维模型空间,并为变量选择和预测提供了可靠的不确定性量化。
  • 模拟结果表明,该方法在高维、低信噪比场景下优于随机森林,而随机森林在此类情形下表现较差。
  • 该方法可通过后验包含概率识别重要预测变量,为主效应和交互作用提供可解释的洞察。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。