Skip to main content
QUICK REVIEW

[论文解读] Multiple-Instance Logistic Regression with LASSO Penalty

Ray‐Bing Chen, Kuang-Hung Cheng|arXiv (Cornell University)|Jul 13, 2016
Spectroscopy and Chemometric Analyses参考文献 11被引用 4
一句话总结

该论文提出了一种带有LASSO惩罚的多实例逻辑回归模型,用于在制造缺陷预测中识别影响因素,其中实例级标签不可观测,仅可获得袋级标签(是否缺陷)。通过使用EM算法进行最大似然估计,并结合LASSO进行变量选择,该方法能有效识别相关预测变量,并在高维设置下(真实效应稀疏)提升预测准确性。

ABSTRACT

In this work, we consider a manufactory process which can be described by a multiple-instance logistic regression model. In order to compute the maximum likelihood estimation of the unknown coefficient, an expectation-maximization algorithm is proposed, and the proposed modeling approach can be extended to identify the important covariates by adding the coefficient penalty term into the likelihood function. In addition to essential technical details, we demonstrate the usefulness of the proposed method by simulations and real examples.

研究动机与目标

  • 解决仅可观察到袋级(受试者级)标签而无实例级标签的制造过程缺陷预测问题。
  • 在实例标签缺失的多实例学习框架下,开发一种统计上严谨的方法来估计逻辑回归系数。
  • 在预测变量数量庞大但仅有少数真正具有影响力的情况下,识别影响缺陷率的重要协变量。
  • 将LASSO惩罚整合到多实例逻辑回归中,实现系数估计与变量选择的同步进行。
  • 与现有MI方法相比,提升预测准确性和变量选择性能,尤其在高维设置下表现更优。

提出的方法

  • 构建一个多实例逻辑回归模型,其中袋级结果取决于袋中至少一个组件为缺陷的概率。
  • 使用期望最大化(EM)算法通过将未观测到的实例标签视为缺失数据,计算最大似然估计。
  • 在对数似然函数中引入LASSO惩罚,以实现系数估计与变量选择的同步进行。
  • 采用贝基信息准则(BIC)和10折交叉验证选择最优正则化参数λ。
  • 推导出似然函数为 L(β₀, β) = ∏ᵢ πᵢᶻⁱ(1−πᵢ)¹⁻ᶻⁱ,其中 πᵢ = 1 − ∏ⱼ(1−pᵢⱼ) 且 pᵢⱼ = 1/(1+exp(−(β₀ + xᵢⱼᵀβ)))。
  • 通过迭代重加权和EM步骤最大化惩罚似然函数,确保收敛至局部最优解。

实验结果

研究问题

  • RQ1当实例级标签缺失时,带有LASSO惩罚的多实例逻辑回归是否能优于标准MI方法来预测缺陷状态?
  • RQ2在高维设置下,所提出的EM-LASSO方法在从大量预测变量中识别真正有影响力的协变量方面效果如何?
  • RQ3在该MI回归背景下,使用BIC进行调参选择是否比10折交叉验证更稳定且更准确?
  • RQ4当袋的大小增加时,模型性能如何变化,尤其是在每个受试者中组件数量较多的情况下?
  • RQ5与现有MI逻辑回归方法相比,该方法在减少偏差和提高估计准确性方面有多大程度的改善?

主要发现

  • 在模拟方案(D)中,使用BIC选择的MILR-LASSO达到61%的准确率和62%的AUC,显著优于MILR-s(3)和MILR-s(0)(分别为58%准确率和57% AUC)。
  • 在模拟方案(E)中,MILR-LASSO达到70%准确率和75% AUC,再次优于基线方法,且BIC与10折CV结果一致。
  • 在模拟方案(F)中,袋大小较大(均值约65),MILR-LASSO保持82%准确率和53% AUC,而基线方法表现较差(18%准确率),表明对高维袋结构具有鲁棒性。
  • 在MUSK1数据集上,MILR-LASSO达到79%预测准确率和83% AUC,优于MILR-s(3)和MILR-s(0)的预测性能,尽管在拟合方面无显著优势。
  • 在MUSK2数据集上,MILR-LASSO达到69%预测准确率和76% AUC,表现出色,即使在袋大小较高且结构复杂的情况下。
  • 该方法通过非零系数估计成功识别出关键特征,展示了其在特征选择和降低缺陷率实际应用中的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。