Skip to main content
QUICK REVIEW

[论文解读] Softplus Regressions and Convex Polytopes

Mingyuan Zhou|arXiv (Cornell University)|Aug 23, 2016
Machine Learning and Algorithms参考文献 67被引用 10
一句话总结

本文提出了一种基于软正切回归的模型,利用多个超平面构成的凸多面体在原始协变量空间中直接构建灵活、非线性的决策边界。通过使用伽马过程对协变量相关的伽马分布进行卷积和堆叠,该方法在显著降低样本外计算成本的同时,实现了与核SVM相当的分类准确率,并提供了可解释的几何约束和贝叶斯不确定性量化。

ABSTRACT

To construct flexible nonlinear predictive distributions, the paper introduces a family of softplus function based regression models that convolve, stack, or combine both operations by convolving countably infinite stacked gamma distributions, whose scales depend on the covariates. Generalizing logistic regression that uses a single hyperplane to partition the covariate space into two halves, softplus regressions employ multiple hyperplanes to construct a confined space, related to a single convex polytope defined by the intersection of multiple half-spaces or a union of multiple convex polytopes, to separate one class from the other. The gamma process is introduced to support the convolution of countably infinite (stacked) covariate-dependent gamma distributions. For Bayesian inference, Gibbs sampling derived via novel data augmentation and marginalization techniques is used to deconvolve and/or demix the highly complex nonlinear predictive distribution. Example results demonstrate that softplus regressions provide flexible nonlinear decision boundaries, achieving classification accuracies comparable to that of kernel support vector machine while requiring significant less computation for out-of-sample prediction.

研究动机与目标

  • 开发一种非参数贝叶斯方法用于非线性分类,避免核方法和深度学习带来的计算负担。
  • 通过定义协变量空间中多个超平面构成的凸多面体或其并集,构建灵活的决策边界。
  • 通过伽马过程先验实现模型复杂度的自动选择,使不必要的组件被收缩至零。
  • 在保持高预测准确率的同时,提供决策边界的可解释几何约束。
  • 通过吉布斯采样结合数据增强和边际化技术,量化模型不确定性并生成完整的后验预测分布。

提出的方法

  • 模型使用软正切函数参数化伽马分布的尺度,实现协变量的平滑、非线性变换。
  • 通过协变量依赖的尺度对可数无限个堆叠伽马分布进行卷积,借助伽马过程先验形成灵活的预测密度。
  • 分层贝叶斯模型将这些卷积和堆叠的伽马分量与伯努利-泊松似然结合,用于二元响应建模。
  • 提出一种新型吉布斯采样算法,利用数据增强和边际化技术对复杂后验分布进行去卷积和解混。
  • 该方法支持在每次MCMC迭代内并行更新参数,提升计算效率。
  • 伽马过程先验可实现对未使用专家(伽马分量)的自动收缩,使在不发生过拟合的前提下可使用较大的 K_max。

实验结果

研究问题

  • RQ1是否可以利用多个超平面在不依赖核函数或深度网络的前提下,在原始协变量空间中定义非线性决策边界?
  • RQ2如何通过协变量依赖的伽马分布的卷积与堆叠来建模二分类中复杂、平滑且灵活的非线性关系?
  • RQ3具有伽马过程先验的非参数贝叶斯框架是否能够自动学习相关分量(专家)的数量,同时避免过拟合?
  • RQ4该方法在多大程度上可实现与核SVM相当的预测准确率,同时降低样本外推理成本?
  • RQ5所得决策边界在几何上如何与凸多面体相关联?是否可在输入空间中实现有意义的解释?

主要发现

  • Sum-和 SS-softplus 回归在八个基准数据集上的分类准确率与核支持向量机相当。
  • 由于决策边界的显式几何结构,样本外预测所需的计算量显著少于核SVM。
  • 即使在 K_max = 20 的情况下,模型仍能自动将不必要专家的权重收缩至零,表明具有有效的模型复杂度控制能力。
  • 对于 ijcnn1 和 a9a 等较大数据集,将 K_max 增加至 50 后进一步观察到收缩现象,证实了自动模型选择的鲁棒性与可扩展性。
  • 吉布斯采样支持高效的后验推断,具有闭式更新形式,支持并行计算与可扩展训练。
  • 该方法可提供完整的后验预测分布,实现不确定性量化与概率预测,且不损失准确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。