[论文解读] SegNBDT: Visual Decision Rules for Segmentation
SegNBDT 是一种用于语义分割的混合神经网络与决策树模型,在可解释模型中实现了最先进(SOTA)的精度——与 SOTA 的 HRNetV2 相比仅相差约 2–4%——同时通过改进的显著性方法和神经网络支持的决策树,生成人类可理解的视觉决策规则(如“是否有窗户?”),在密集预测任务中实现了高性能与模型可解释性的统一。
The black-box nature of neural networks limits model decision interpretability, in particular for high-dimensional inputs in computer vision and for dense pixel prediction tasks like segmentation. To address this, prior work combines neural networks with decision trees. However, such models (1) perform poorly when compared to state-of-the-art segmentation models or (2) fail to produce decision rules with spatially-grounded semantic meaning. In this work, we build a hybrid neural-network and decision-tree model for segmentation that (1) attains neural network segmentation accuracy and (2) provides semi-automatically constructed visual decision rules such as "Is there a window?". We obtain semantic visual meaning by extending saliency methods to segmentation and attain accuracy by leveraging insights from neural-backed decision trees, a deep learning analog of decision trees for image classification. Our model SegNBDT attains accuracy within ~2-4% of the state-of-the-art HRNetV2 segmentation model while also retaining explainability; we achieve state-of-the-art performance for explainable models on three benchmark datasets -- Pascal-Context (49.12%), Cityscapes (79.01%), and Look Into Person (51.64%). Furthermore, user studies suggest visual decision rules are more interpretable, particularly for incorrect predictions. Code and pretrained models can be found at https://github.com/daniel-ho/SegNBDT.
研究动机与目标
- 解决高精度深度学习模型在密集预测任务(如语义分割)中可解释性不足的问题。
- 克服后处理解释方法(如显著性图)仅关注输入像素、忽略模型内部决策过程的局限性。
- 开发一种分割模型,在保持与最先进神经网络相当的竞争力精度的同时,生成语义上有意义且空间上定位准确的视觉决策规则。
- 使从业者和用户能够通过源自显著性分析的透明、基于规则的推理,理解正确与错误的预测。
- 通过将高精度深度学习与本质上可解释的模型(如决策树)整合到统一的端到端可训练框架中,弥合两者之间的差距。
提出的方法
- 提出 SegNBDT,一种用于分割的神经网络支持决策树(NBDT)架构,通过在权重空间学习决策规则,结合深度特征与树状结构推理。
- 通过引入梯度加权像素激活映射(Grad-PAM),将显著性方法适配到分割任务中,这是一种针对任意像素查询显著性的空间感知变体,类似于 Grad-CAM。
- 提出语义输入移除(SIR),一种语义感知的 RISE 变体,通过基于类别语义移除图像区域来评估特征重要性。
- 开发最小必要上下文(MRC),以优化有效感受野,并识别树中每个决策所需的最小输入上下文。
- 利用外部数据集提供的细粒度分割标签引导显著性分析,从而更好地理解模型在各类别上的行为。
- 通过分析树节点上的显著性图构建视觉决策规则,生成如“分类汽车时关注车轮”或“识别长型车辆时检测窗户”等规则。
实验结果
研究问题
- RQ1混合神经网络与决策树的模型能否在保持竞争性分割精度的同时,生成具有语义意义的人类可理解的视觉决策规则?
- RQ2如何将显著性方法适配到分割任务中,以生成空间和语义上定位准确的决策规则,而非仅限于像素级别的归因?
- RQ3与标准显著性图(如 Grad-CAM)相比,视觉决策规则在多大程度上提升了可解释性,尤其是在错误预测的情况下?
- RQ4将基于显著性的分析整合到决策树框架中,是否能产生比后处理解释方法更可验证、更一致的解释?
- RQ5在标准基准上,SegNBDT 的性能与 HRNetV2 等最先进模型相比,在精度和可解释性方面如何?
主要发现
- SegNBDT 在三个基准数据集上实现了可解释模型中的最先进性能:在 Pascal-Context 上达到 49.12% mIoU,在 Cityscapes 上达到 79.01%,在 Look Into Person 上达到 51.64%。
- 该模型的分割精度与 SOTA 的 HRNetV2 基线相比仅相差约 2–4%,证明了在分割任务中高精度与可解释性可以兼得。
- 用户研究表明,59.9% 的参与者更倾向于使用 SegNBDT 的视觉决策规则而非 Grad-CAM 来解释预测结果,当预测错误时,这一比例上升至 80.0%。
- Grad-PAM 揭示了空间上连贯且语义上有意义的显著性模式:深层节点聚焦于更具体的特征(如骑车者 vs. 一般人物),不同树路径关注不同的视觉概念。
- SIR 识别出分类中语义上关键的组成部分——例如,车灯在区分汽车与非汽车时最为重要,而窗户等共享部分则影响较小。
- 连续决策规则的显著性图并不总是缩小;在某些情况下,其范围扩大或焦点转移(如添加道路特征以区分人行道),表明树层级间存在动态推理过程。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。