[论文解读] ProtoVAE: A Trustworthy Self-Explainable Prototypical Variational Model
ProtoVAE 是一种基于变分自编码器(VAE)的自解释模型,以端到端方式学习类特定、可解释的原型,通过正交性约束和共享 VAE 主干网络,实现透明性、多样性和可信性。该模型在五个图像数据集上实现了最先进性能,同时保持了忠实、多样且视觉可解释的解释,且未牺牲预测准确性。
The need for interpretable models has fostered the development of self-explainable classifiers. Prior approaches are either based on multi-stage optimization schemes, impacting the predictive performance of the model, or produce explanations that are not transparent, trustworthy or do not capture the diversity of the data. To address these shortcomings, we propose ProtoVAE, a variational autoencoder-based framework that learns class-specific prototypes in an end-to-end manner and enforces trustworthiness and diversity by regularizing the representation space and introducing an orthonormality constraint. Finally, the model is designed to be transparent by directly incorporating the prototypes into the decision process. Extensive comparisons with previous self-explainable approaches demonstrate the superiority of ProtoVAE, highlighting its ability to generate trustworthy and diverse explanations, while not degrading predictive performance.
研究动机与目标
- 为解决现有自解释模型(SEMs)通常牺牲预测性能,或在解释中缺乏透明性和多样性的问题。
- 定义并实现自解释模型的三个核心属性:透明性、多样性和可信性,以支持系统性评估。
- 开发一种统一的、端到端的框架,直接在潜在空间中学习全局原型,避免依赖最近邻训练样本作为代理。
- 通过引入正交性约束和基于相似度的决策机制,确保解释的忠实性和鲁棒性。
- 证明自解释模型可在保持可信、人类可解释洞察的同时,达到或超越黑箱模型的性能。
提出的方法
- ProtoVAE 使用基于变分自编码器(VAE)的共享编码器-解码器架构,每个类别具有以类特定原型为中心的高斯先验。
- 模型以共享方式训练多个 VAE,每个 VAE 条件于不同的原型,从而实现重建和分类的端到端优化。
- 对每个类内的原型施加正交性约束,以增强类内多样性,防止原型坍缩为单一点。
- 最终预测通过输入表示与每个原型之间相似度得分的加权和计算,确保决策过程的透明性。
- 通过基于梯度的相关性反向传播,从相似度得分生成局部像素级解释,映射回输入空间。
- 损失函数结合了重建损失、分类损失和正则化项,以平衡保真度、多样性和可信性。
实验结果
研究问题
- RQ1自解释模型能否在保持输入空间中完全透明的全局原型的同时,实现高预测性能?
- RQ2如何在自解释模型中强制实现原型多样性,以防止坍缩并提升鲁棒性?
- RQ3VAE 架构在不牺牲准确性的前提下,能在多大程度上支持忠实、多样且可信的解释?
- RQ4ProtoVAE 生成的解释与现有方法(如 ProtoPNet 和 SENN)相比,在定量和定性上表现如何?
- RQ5在扰动下,模型的解释保真度是否具有鲁棒性,通过相关性排序和消融测试衡量?
主要发现
- 在所有数据集上,ProtoVAE 的激活差异(AD)显著低于 ProtoPNet,且保真度(AI)更高,其中 MNIST 上 AD 为 0.4 ± 0.0,CIFAR-10 上为 6.6 ± 0.0,而 ProtoPNet 分别为 3.4 ± 0.3 和 11.6 ± 0.2。
- 在 SVHN 数据集上,ProtoVAE 实现了与 ProtoPNet 相当的 AI(0.7 ± 0.0),但 AD 更低(6.1 ± 0.1),而 ProtoPNet 为 5.4 ± 0.0 AD 和 0.7 ± 0.0 AI,表明其解释更可靠。
- 在相关性排序测试中,ProtoVAE 在 MNIST、QuickDraw 和 SVHN 上均优于 ProtoPNet 及其随机基线,曲线下面积更高,表明更准确捕捉了相关特征。
- ProtoPNet 在 MNIST 的相关性测试中表现甚至劣于随机基线,表明其解释不可信,可能具有误导性。
- ProtoVAE 保持了高预测准确性,与黑箱基线模型相当或更优,证明自解释性不会以性能为代价。
- 该模型的全局原型可直接在输入空间中可视化,且并非通过最近邻训练样本近似,确保了真正的透明性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。