Skip to main content
QUICK REVIEW

[论文解读] Towards Wide Learning: Experiments in Healthcare

Snehasis Banerjee, Tanushyam Chattopadhyay|arXiv (Cornell University)|Dec 17, 2016
Phonocardiography and Auscultation Techniques参考文献 5被引用 3
一句话总结

本文提出一种广义学习架构,以自动化医疗机器学习中的特征工程,采用分层特征列举与混合特征选择(mRMR 和 MRMS)结合 SVM 的方法。仅用 3 个人日即达到 PhysioNet 挑战赛优胜者 94.38% 的准确率,优于两种数据集上的最先进方法,同时提供可解释、人类可理解的特征,且显著降低工作量。

ABSTRACT

In this paper, a Wide Learning architecture is proposed that attempts to automate the feature engineering portion of the machine learning (ML) pipeline. Feature engineering is widely considered as the most time consuming and expert knowledge demanding portion of any ML task. The proposed feature recommendation approach is tested on 3 healthcare datasets: a) PhysioNet Challenge 2016 dataset of phonocardiogram (PCG) signals, b) MIMIC II blood pressure classification dataset of photoplethysmogram (PPG) signals and c) an emotion classification dataset of PPG signals. While the proposed method beats the state of the art techniques for 2nd and 3rd dataset, it reaches 94.38% of the accuracy level of the winner of PhysioNet Challenge 2016. In all cases, the effort to reach a satisfactory performance was drastically less (a few days) than manual feature engineering.

研究动机与目标

  • 自动化医疗机器学习中耗时且依赖专业知识的特征工程过程。
  • 开发一种分层、可解释的特征推荐系统,支持因果性分析与领域知识整合。
  • 将构建高性能机器学习模型在临床分析中的工作量从数月减少至数天。
  • 在真实医疗数据集上,超越最先进方法(包括深度学习与 PCA),并提供可解释的特征。

提出的方法

  • 该方法采用分层特征列举:第 0 层包括时域、基于傅里叶(STFT)和基于小波(DWT)的特征;第 1 层增加谱特征、统计特征和峰谷特征;第 2 层计算第 1 层特征的比值与导数。
  • 通过能量-熵比自动选择母小波,以优化 DWT 特征提取。
  • 特征选择结合 mRMR(通过互信息最小化冗余、最大化相关性)与 MRMS(基于模糊粗糙集的相关性与重要性评分),以识别最优特征子集。
  • 最终特征集为 mRMR 与 MRMS 输出的并集,通过迭代选择大小为 k 的子集,并使用不同核函数的 SVM 进行评估。
  • 性能通过 p 折交叉验证(p=5–10)后的隐藏测试集准确率进行评估,同时使用基于 Theano 的 MLP 与 Dropout 方法进行对比。
  • 系统通过支持插件新特征提取算法,具备可扩展性,可构建协作式特征工程生态系统。

实验结果

研究问题

  • RQ1自动化特征推荐系统是否能在医疗机器学习任务中实现与人工特征工程相当的性能?
  • RQ2所提出的广义学习架构结合分层特征工程,是否在有限医疗数据集上优于最先进方法(包括深度学习与 PCA)?
  • RQ3该方法是否能显著减少模型开发所需的时间与专业知识,同时保持或提升准确率?
  • RQ4所推荐的特征在多大程度上具备可解释性,并适用于临床因果性分析?
  • RQ5mRMR 与 MRMS 的联合使用如何改善特征选择效果,相比单独使用任一方法?

主要发现

  • 所提方法在 PhysioNet Challenge 2016 数据集上达到 84% 的准确率,仅用 3 个人日即实现优胜者准确率(0.89)的 94.38%,而人工特征工程耗时 120 个人日。
  • 在 MIMIC-II 血压分类数据集上,该方法达到 87.8% 的准确率,超过最先进水平(79.5%),并优于 MLP(50%)与 PCA+SVM(62.5%)方法。
  • 在内部情感分类数据集上,该方法达到 90.9% 的准确率,超过最先进水平(82.3%),显著优于 MLP(50%)与 PCA+SVM(50%)方法。
  • 该方法将开发工作量减少至每数据集仅 2–3 个人日,相比人工特征工程的 90–130 个人日,展现出显著的效率提升。
  • 与深度学习和 PCA 不同,该方法生成可解释的特征,可提供临床洞察与因果性分析支持,这对医疗应用至关重要。
  • mRMR 与 MRMS 的混合使用通过捕捉相关性与重要性的互补方面,提升了性能,优于单独使用任一方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。