Skip to main content
QUICK REVIEW

[论文解读] Sparsity in Continuous-Depth Neural Networks

Hananeh Aliee, Till Richter|arXiv (Cornell University)|Oct 26, 2022
Model Reduction and Neural Networks被引用 5
一句话总结

本文提出 PathReg,一种基于可微分 L0 的正则化方法,通过在神经微分方程(Neural ODEs)中强制输入-输出路径的稀疏性,实现特征与权重的双重稀疏性。实验证明,与权重稀疏性不同,特征稀疏性能提升泛化性能,并可准确恢复真实底层动力学规律,尤其在真实世界运动捕捉和单细胞 RNA-seq 数据的系统辨识任务中表现优异。

ABSTRACT

Neural Ordinary Differential Equations (NODEs) have proven successful in learning dynamical systems in terms of accurately recovering the observed trajectories. While different types of sparsity have been proposed to improve robustness, the generalization properties of NODEs for dynamical systems beyond the observed data are underexplored. We systematically study the influence of weight and feature sparsity on forecasting as well as on identifying the underlying dynamical laws. Besides assessing existing methods, we propose a regularization technique to sparsify "input-output connections" and extract relevant features during training. Moreover, we curate real-world datasets consisting of human motion capture and human hematopoiesis single-cell RNA-seq data to realistically analyze different levels of out-of-distribution (OOD) generalization in forecasting and dynamics identification respectively. Our extensive empirical evaluation on these challenging benchmarks suggests that weight sparsity improves generalization in the presence of noise or irregular sampling. However, it does not prevent learning spurious feature dependencies in the inferred dynamics, rendering them impractical for predictions under interventions, or for inferring the true underlying dynamics. Instead, feature sparsity can indeed help with recovering sparse ground-truth dynamics compared to unregularized NODEs.

研究动机与目标

  • 探究权重稀疏性与特征稀疏性在连续深度神经网络中对泛化性能的影响,特别是在分布外(OOD)设置下的表现。
  • 解决神经微分方程中稀疏性在系统辨识任务中(超越分布内预测)的未充分探索作用。
  • 开发一种新型正则化技术,直接针对输入-输出路径的稀疏性,以提升可解释性与因果结构恢复能力。
  • 整理并发布真实世界基准数据集——人体运动捕捉数据(mocap.cs.cmu.edu)与造血系统单细胞 RNA-seq 数据——用于评估神经微分方程在 OOD 设置下的泛化能力。
  • 在预测性能、稀疏性与动力学规律恢复能力方面,将 PathReg 与现有方法(如 LassoNet、GroupLasso、C-NODE)进行比较。

提出的方法

  • 提出 PathReg,一种基于可微分 L0 的正则化方法,通过软化 L0 范数的松弛方式,鼓励权重精确为零,从而在神经微分方程中剪枝整个输入-输出路径。
  • 将 L0 正则化与 LassoNet 扩展至连续深度设置,使神经微分方程在权重与特征层面均实现结构化稀疏性。
  • 采用基于路径的稀疏性准则,评估每个输入特征在模型深度范围内对每个输出神经元的贡献,实现在路径层级的稀疏性约束。
  • 在真实世界数据集上训练神经微分方程模型,包括人体运动捕捉数据(mocap.cs.cmu.edu)与造血系统单细胞 RNA-seq 数据,将时间视为伪时间。
  • 使用测试均方误差(MSE)、稀疏度水平与邻接矩阵等指标评估模型性能,以衡量特征重要性与交互作用恢复能力。
  • 在预测准确性、稀疏性与推断基因调控网络的生物学合理性方面,将 PathReg 与基线模型(如原始 NODE、C-NODE、基于 NODE 的 GroupLasso 与 LassoNet)进行比较。

实验结果

研究问题

  • RQ1神经微分方程中的特征稀疏性是否能提升轨迹预测与动力系统辨识任务中的分布外(OOD)泛化能力?
  • RQ2如 PathReg 这类基于路径的正则化技术,能否在保持预测性能的前提下有效实现输入-输出连接的稀疏性?
  • RQ3在缺乏真实因果结构的情况下,不同稀疏化方法(权重稀疏性 vs. 特征稀疏性)在恢复真实动力学规律方面的表现如何比较?
  • RQ4特征稀疏性在从单细胞 RNA-seq 数据中识别出生物上合理的基因调控网络方面,其作用程度如何?
  • RQ5在输入-输出路径上强制稀疏性是否能减少虚假特征依赖关系,从而改善基于干预的预测或因果推断?

主要发现

  • PathReg 在多个真实世界数据集(包括运动捕捉与单细胞 RNA-seq)上,均在预测性能、稀疏性与 OOD 泛化能力方面优于其他方法。
  • 权重稀疏性虽能提升对噪声与不规则采样数据的鲁棒性,但无法防止学习到虚假的特征依赖关系,限制了其在因果推断中的应用价值。
  • 通过 PathReg 实现的特征稀疏性,可准确恢复已知的造血系统转录因子-基因相互作用(如 RUNX1、GATA1、ETV6),优于未正则化的神经微分方程模型。
  • PathReg 有效去除了未被证实存在直接关联的基因之间的非因果相互作用,而其他模型则未能消除此类虚假特征。
  • PathReg 与 L0 方法推断出的邻接矩阵具有更高的生物学合理性,能正确识别出已知的红系转录因子作为关键调控因子。
  • 在系统辨识任务中,特征稀疏性比权重稀疏性更有效地识别真实底层动力学规律,尤其在对可解释性与因果性要求较高的场景中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。