Skip to main content
QUICK REVIEW

[论文解读] DeepCoDA: personalized interpretability for compositional health data

Thomas P. Quinn, Dang Nguyen|arXiv (Cornell University)|Jun 2, 2020
Biomedical Text Mining and Ontologies参考文献 26被引用 6
一句话总结

DeepCoDA 是一种深度学习框架,通过使用对数瓶颈模块学习可解释的对数对比变换和患者特异性权重,实现了对组成性健康数据(在高通量测序中常见)的个性化可解释性。它在25个真实世界数据集上实现了最先进性能,同时确保解释结果具有生物学一致性且无需依赖归一化假设。

ABSTRACT

Interpretability allows the domain-expert to directly evaluate the model's relevance and reliability, a practice that offers assurance and builds trust. In the healthcare setting, interpretable models should implicate relevant biological mechanisms independent of technical factors like data pre-processing. We define personalized interpretability as a measure of sample-specific feature attribution, and view it as a minimum requirement for a precision health model to justify its conclusions. Some health data, especially those generated by high-throughput sequencing experiments, have nuances that compromise precision health models and their interpretation. These data are compositional, meaning that each feature is conditionally dependent on all other features. We propose the Deep Compositional Data Analysis (DeepCoDA) framework to extend precision health modelling to high-dimensional compositional data, and to provide personalized interpretability through patient-specific weights. Our architecture maintains state-of-the-art performance across 25 real-world data sets, all while producing interpretations that are both personalized and fully coherent for compositional data.

研究动机与目标

  • 解决精准健康模型在组成性数据(如微生物组或代谢组谱)中缺乏个性化可解释性的问题。
  • 克服组成性数据带来的统计与可解释性挑战,其中特征为相对比例且条件相关。
  • 开发一种神经网络架构,在保持高预测性能的同时支持样本特异性特征归因。
  • 确保解释结果具有生物学意义,并独立于数据预处理或归一化假设。
  • 提出两级可解释性框架:(1) 用于预测的患者特异性权重,(2) 用于特征层面洞察的对数对比贡献。

提出的方法

  • 提出一种对数瓶颈模块,通过梯度下降端到端学习 B 个对数对比变换,其中每个对数对比是经过对数变换的特征的线性组合,且权重之和为零。
  • 通过线性模型 $ y = \theta(\mathbf{x})^\top \mathbf{x} $ 实现自解释,其中 $ \theta(\mathbf{x}) $ 为患者特异性权重,以实现可解释性。
  • 对自解释权重施加 L1 正则化,以鼓励稀疏性并提升可解释性,同时通过学习到的对数对比表示允许非线性交互。
  • 通过使用对数比(对数对比)转换输入特征,以处理组成性数据结构,避免任意归一化。
  • 使用反向传播端到端训练模型,对数瓶颈模块从数据中学习最优对比,而非依赖预定义或用户指定的变换。
  • 通过检查患者特异性权重与对数对比值之间的相关性,实现对模型行为的后 hoc 分析,以检测高阶交互(例如,$ w_i \propto z_j $)。

实验结果

研究问题

  • RQ1深度学习模型是否能在不依赖数据归一化或预处理假设的前提下,实现对组成性健康数据的个性化可解释性?
  • RQ2如何在神经网络中自动学习对数对比变换,以在组成性数据中保持可解释性与一致性?
  • RQ3自解释模型中的患者特异性权重在多大程度上能揭示高维组成性数据中的生物学上有意义的模式?
  • RQ4模型的内部结构(如对数对比权重)是否可用于推断超越简单加法效应的高阶生物相互作用?
  • RQ5该框架是否在多样化的现实世界组成性数据集中保持强大的预测性能,同时支持透明的样本级解释?

主要发现

  • DeepCoDA 在 25 个真实世界的组成性数据集(包括微生物组和代谢组研究)上实现了最先进性能,且无需超参数调优。
  • 模型的自解释模块生成了患者特异性权重,实现了直接、可解释的特征归因,产品得分 $ w_i z_i $ 明确指示了对预测贡献最大的特征。
  • 对数瓶颈模块成功学习了具有生物学意义的对数对比,部分对数对比包含多达 144 个特征(共 153 个),尽管贡献分布不均匀,但仍可通过主要贡献者实现有效总结。
  • 后 hoc 分析揭示了高阶交互:例如,对数对比 5 的重要性取决于对数对比 3 的值,表明存在对数乘法交互 $ w_5 \propto z_3 $,这在最终预测中可转化为 $ w_5 z_5 \approx z_3 z_5 $。
  • 该框架提供了两级可解释性:(1) 用于预测的患者级权重,(2) 用于显示每个对比中哪些特征有贡献的对数对比级权重,使临床医生能够追踪生物学机制。
  • 模型的可解释性对数据结构具有鲁棒性,因其避免了归一化假设,转而使用学习到的对数对比,确保解释结果在组成性空间中保持一致且有意义。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。