Skip to main content
QUICK REVIEW

[论文解读] Ultra High-Dimensional Nonlinear Feature Selection for Big Biological Data

Makoto Yamada, Jiliang Tang|arXiv (Cornell University)|Aug 14, 2016
Metabolomics and Mass Spectrometry Studies参考文献 48被引用 9
一句话总结

本文提出 LAND(Least Angle Nonlinear Distributed)方法,一种可扩展的特征选择技术,结合 HSIC Lasso 与分布式计算,从超高维生物数据中识别出最小且高度预测性、非冗余的特征集——在真实数据集(如前列腺癌表型和酶分类)上实现高达 99.998% 的降维率,同时保持或提升预测准确率。

ABSTRACT

Machine learning methods are used to discover complex nonlinear relationships in biological and medical data. However, sophisticated learning models are computationally unfeasible for data with millions of features. Here we introduce the first feature selection method for nonlinear learning problems that can scale up to large, ultra-high dimensional biological data. More specifically, we scale up the novel Hilbert-Schmidt Independence Criterion Lasso (HSIC Lasso) to handle millions of features with tens of thousand samples. The proposed method is guaranteed to find an optimal subset of maximally predictive features with minimal redundancy, yielding higher predictive power and improved interpretability. Its effectiveness is demonstrated through applications to classify phenotypes based on module expression in human prostate cancer patients and to detect enzymes among protein structures. We achieve high accuracy with as few as 20 out of one million features --- a dimensionality reduction of 99.998%. Our algorithm can be implemented on commodity cloud computing platforms. The dramatic reduction of features may lead to the ubiquitous deployment of sophisticated prediction models in mobile health care applications.

研究动机与目标

  • 解决将非线性机器学习方法应用于具有数百万个特征和数万个样本的超高维生物数据集的挑战。
  • 开发一种特征选择方法,以识别出预测能力最强、冗余度最低的特征,从而提升模型的可解释性与性能。
  • 实现在通用云平台上的分布式、可扩展的非线性特征选择,克服现有方法的局限性。
  • 在真实生物问题(如癌症表型分类和酶检测)上验证该方法的有效性。

提出的方法

  • LAND 将最小角回归(LARS)与希尔伯特-施密特独立性准则(HSIC)相结合,实现非线性、非冗余的特征选择。
  • 该方法采用 LARS 的非负变体,以确保稀疏且全局最优的特征子集选择。
  • 采用随机化压缩技术,参数 $ b \ll n $,将内存复杂度从 $ O(dn^2) $ 降低至 $ O(dbn) $,从而实现对 $ d \approx 10^6 $ 个特征的可扩展处理。
  • 该算法在通用云平台以分布式方式实现,可高效处理大规模数据集。
  • 特征选择基于最大化所选特征与目标变量之间的非线性依赖性(通过 HSIC),同时最小化特征之间的冗余性。
  • 采用自定义特征表示方法——最多包含四个残基的根图子结构(rooted graphlets),将蛋白质结构编码为高维向量,用于酶检测。

实验结果

研究问题

  • RQ1非线性特征选择方法能否扩展至具有超过一百万个特征和数万个样本的数据集?
  • RQ2能否有效利用分布式计算,在高维生物数据中实现可扩展的非线性特征选择?
  • RQ3所提出的方法在预测准确率和降维能力方面是否优于当前最先进的线性和非线性基线方法?
  • RQ4所选特征是否具有生物学可解释性,例如能否识别出如 DH(天冬氨酸-组氨酸)等已知的催化结构域?

主要发现

  • 在酶分类任务中,LAND 将特征数量从 1,062,420 个减少至仅 20 个,实现了 99.998% 的降维率,同时保持了高准确率。
  • 在前列腺癌数据集中,LAND 仅使用一百万个特征中的 20 个即实现了高分类准确率,证明了其强大的预测能力与极低的冗余性。
  • 在选择少于 100 个特征时,LAND 的准确率高于所有基线方法(包括 mRMR 和 MR-NHSIC),尤其在极低维区域表现更优。
  • 该方法在集群上仅耗时 3 小时,而同一酶数据集上完整图核分类器需 18 天,显示出显著的速度提升。
  • 冗余性分析(图 6(B))证实,LAND 所选特征的冗余性显著低于基线方法。
  • LAND 有效识别出具有生物学意义的结构域,如已知常见于催化位点的 DH(天冬氨酸-组氨酸)图子结构,验证了其生物学可解释性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。