[论文解读] Learning Global Pairwise Interactions with Bayesian Neural Networks
该论文提出贝叶斯组期望海森矩阵(GEH),一种非参数化概率方法,利用贝叶斯神经网络(BNNs)估计全局成对交互效应。通过在数据聚类上聚合基于局部海森矩阵的交互效应,GEH 提供了具有不确定性量化的全局可解释性交互检测,且随着 BNN 性能提升而表现更优,优于非概率基线方法,并能发现可解释的高层级特征交互。
Estimating global pairwise interaction effects, i.e., the difference between the joint effect and the sum of marginal effects of two input features, with uncertainty properly quantified, is centrally important in science applications. We propose a non-parametric probabilistic method for detecting interaction effects of unknown form. First, the relationship between the features and the output is modelled using a Bayesian neural network, capable of representing complex interactions and principled uncertainty. Second, interaction effects and their uncertainty are estimated from the trained model. For the second step, we propose an intuitive global interaction measure: Bayesian Group Expected Hessian (GEH), which aggregates information of local interactions as captured by the Hessian. GEH provides a natural trade-off between type I and type II error and, moreover, comes with theoretical guarantees ensuring that the estimated interaction effects and their uncertainty can be improved by training a more accurate BNN. The method empirically outperforms available non-probabilistic alternatives on simulated and real-world data. Finally, we demonstrate its ability to detect interpretable interactions between higher-level features (at deeper layers of the neural network).
研究动机与目标
- 解决现有方法在复杂非线性数据中检测全局成对交互效应时缺乏不确定性量化的问题。
- 开发一种检测全局交互效应的方法——与局部交互方法不同——且无需预先指定交互形式。
- 实现在深度神经网络学习的高层级特征之间可解释的交互检测。
- 提供理论保证:随着贝叶斯神经网络校准程度提高,交互估计的性能也将提升。
- 提供一种实用且可扩展的方法,适用于统计误差控制与可解释性至关重要的科学发现场景。
提出的方法
- 使用贝叶斯神经网络(BNN)建模输入与输出之间的关系,实现复杂交互的灵活非参数化表示,并提供不确定性量化。
- 通过 BNN 预测函数的海森矩阵计算局部交互效应,捕捉每个数据点处的二阶交互。
- 利用基于组的平均方案,将数据聚类中的局部海森矩阵交互得分聚合,以估计全局成对交互。
- 通过 L2 距离进行聚类,将输入空间划分为区域,确保局部交互能稳健聚合为全局度量。
- 利用贝叶斯组期望海森矩阵(GEH)的后验分布,量化交互估计的不确定性,从而支持假设检验。
- 利用深层网络的层次结构,检测并解释高层特征(如深层神经元)之间的交互,使用激活最大化进行解释。
实验结果
研究问题
- RQ1非参数化概率方法是否能在不假设特定函数形式的前提下检测全局成对交互?
- RQ2如何正确量化交互估计的不确定性,以支持统计假设检验?
- RQ3通过训练更准确的贝叶斯神经网络,是否可以改进交互检测?
- RQ4能否检测并有意义地解释深度网络学习的高层级特征之间的交互?
- RQ5与现有非概率交互检测技术相比,所提出方法在准确性和鲁棒性方面是否表现更优?
主要发现
- 所提出的贝叶斯 GEH 方法在模拟数据和真实世界数据集上检测全局成对交互时,优于非概率的最先进基线方法。
- 该方法为交互效应提供了不确定性估计,通过调节聚类数量可自然权衡第一类错误与第二类错误。
- GEH 估计随着更校准的贝叶斯神经网络而改善,这是现有基于深度学习的交互检测方法所无法保证的理论优势。
- 该方法在 MNIST 数据集中成功检测到高层级特征之间的可解释交互,例如“左侧行7”与“右侧行0”,与人类直觉一致。
- 在 MNIST 实验中,每个任务中检测到的最强交互恰好对应于正类(如 (7,0) 和 (5,3)),并通过激活最大化确认了正确解释。
- 通过 L2 距离进行聚类并采用启发式聚类数量选择方法表现稳定,但若采用考虑交互效应的其他距离度量,性能可能进一步提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。