Skip to main content
QUICK REVIEW

[论文解读] Variable Selection with Copula Entropy

Jian Ma|arXiv (Cornell University)|Oct 28, 2019
Spectroscopy and Chemometric Analyses参考文献 31被引用 15
一句话总结

本文提出了一种基于互克劳拉熵(Copula Entropy, CE)的无模型、无调参变量选择方法,用于根据预测变量与响应变量之间的依赖强度对变量进行排序和选择。该方法在选择相关且可解释的变量方面优于传统方法(如距离相关性、HSIC、逐步选择法及正则化模型),且不牺牲预测准确性,尤其在 UCI 心脏病数据集上表现突出。

ABSTRACT

Variable selection is of significant importance for classification and regression tasks in machine learning and statistical applications where both predictability and explainability are needed. In this paper, a Copula Entropy (CE) based method for variable selection which use CE based ranks to select variables is proposed. The method is both model-free and tuning-free. Comparison experiments between the proposed method and traditional variable selection methods, such as Distance Correlation, Hilbert-Schmidt Independence Criterion, Stepwise Selection, regularized generalized linear models and Adaptive LASSO, were conducted on the UCI heart disease data. Experimental results show that CE based method can select the `right' variables out more effectively and derive better interpretable results than traditional methods do without sacrificing accuracy performance. It is believed that CE based variable selection can help to build more explainable models.

研究动机与目标

  • 解决在高维、非线性、非高斯数据中选择相关预测变量的挑战,传统基于相关性的方法在此类数据中失效。
  • 开发一种既无模型依赖又无调参需求的变量选择方法,避免对参数假设或超参数调优的依赖。
  • 通过基于信息论中统计意义依赖度量的变量选择,提升模型的可解释性。
  • 在选择临床相关变量方面,超越现有方法(如距离相关性、HSIC、AIC/BIC 逐步选择法及正则化模型)。
  • 确立互克劳拉熵作为真实世界应用中变量选择的合理、公理化且具有物理解释性的度量标准。

提出的方法

  • 该方法使用互克劳拉熵(CE)作为每个预测变量与响应变量之间依赖关系的度量,以一种对单调变换不变的方式量化统计依赖性。
  • 根据 CE 值对变量进行排序,CE 值越高表示依赖性越强,因此与响应变量的相关性越高。
  • 该方法为无模型方法,因为它不假设预测变量与响应变量之间关系的具体参数形式。
  • 该方法为无调参方法,因为无需任何超参数(如正则化强度),与 LASSO 或岭回归不同。
  • 该方法利用了熵的公理化性质,包括对单调变换的不变性以及在高斯假设下的行为一致性。
  • 通过根据 CE 值选择排名靠前的变量,执行变量选择,形成与响应变量依赖性最大的子集。

实验结果

研究问题

  • RQ1互克劳拉熵能否作为现有依赖度量在变量选择中的一种可靠、无模型且无调参的替代方案?
  • RQ2与距离相关性、HSIC、AIC/BIC 及正则化模型等传统方法相比,基于 CE 的变量选择在预测准确性和选择效率方面表现如何?
  • RQ3基于 CE 的选择是否能产生比其他方法更具可解释性和临床意义的变量子集?
  • RQ4在捕捉真实世界数据中的非线性、非高斯依赖关系方面,CE 相较于 dCor 和 dHSIC 的表现优势有多大?
  • RQ5基于 CE 的选择是否能在不依赖稀疏性或模型正确性等限制性假设的前提下实现更优性能?

主要发现

  • 基于 CE 的方法在 UCI 心脏病数据集中选择的变量与临床公认的预测因子高度一致,展现出强大的可解释性。
  • 该方法在选择准确性和预测性能方面均优于距离相关性和 HSIC,且 CE 在检测有意义的非线性依赖关系方面表现出更优能力。
  • 与使用 AIC/BIC 的逐步选择法相比,CE 方法选择了更多相关变量,并避免了模型误设和近似偏差的问题。
  • 尽管自适应 LASSO 具有 oracle 性质,但其选择的变量数量少于 CE 方法,后者捕捉到了诸如与额外血管相关的额外临床有意义特征。
  • 基于 CE 的模型在预测准确性方面与所有基线方法相当或更优,同时提供了基于统计依赖性的更可解释的变量子集。
  • 结果表明,基于 CE 的变量选择比依赖参数假设或正则化调优的方法更具鲁棒性和普适性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。