Skip to main content
QUICK REVIEW

[论文解读] Hide-and-Seek: A Template for Explainable AI

Thanos Tagaris, Andreas Stafylopatis|arXiv (Cornell University)|Apr 30, 2020
Explainable Artificial Intelligence (XAI)参考文献 61被引用 6
一句话总结

本文提出了一种名为 Hide-and-Seek(HnS)的新框架,该框架通过联合训练两个神经网络(一个‘寻找者’用于分类,另一个‘隐藏者’用于掩码无关输入区域)来实现模型的可解释性。通过同时优化分类准确率和输入掩码,HnS 在不牺牲预测性能的前提下实现了高可解释性,证明了保真度与可解释性并非本质上相互冲突。

ABSTRACT

Lack of transparency has been the Achilles heal of Neural Networks and their wider adoption in industry. Despite significant interest this shortcoming has not been adequately addressed. This study proposes a novel framework called Hide-and-Seek (HnS) for training Interpretable Neural Networks and establishes a theoretical foundation for exploring and comparing similar ideas. Extensive experimentation indicates that a high degree of interpretability can be imputed into Neural Networks, without sacrificing their predictive power.

研究动机与目标

  • 为解决深度神经网络在视觉和自然语言处理应用中可解释性不足的问题。
  • 开发一种框架,实现在不损害预测性能的前提下实现高可解释性。
  • 为衡量和平衡神经网络中的保真度与可解释性提供理论与实证基础。
  • 探究确定性与随机掩码策略对模型稳定性与可解释性的影响。
  • 提供一种可推广的模板,适用于视觉、自然语言处理和结构化数据等各类任务。

提出的方法

  • HnS 框架使用两个神经网络:一个用于分类的‘寻找者’和一个用于掩码输入特征的‘隐藏者’。
  • 隐藏者被训练以识别并掩码无信息量的输入区域,而寻找者则基于剩余可见特征进行分类。
  • 采用联合损失函数,结合分类损失与掩码损失,并通过自适应加权来平衡保真度与可解释性。
  • 框架采用确定性与随机阈值法生成输入掩码,从而实现对探索或利用的可控调节。
  • 可解释性通过被掩码的输入比例来量化,而保真度则通过分类准确率来衡量。
  • 该方法在四个图像分类数据集上直接应用,无需任务特定的微调,展示了良好的泛化能力。

实验结果

研究问题

  • RQ1是否可以通过联合优化分类与掩码任务,训练出既高度准确又高度可解释的神经网络?
  • RQ2人们普遍认为神经网络中保真度与可解释性之间存在权衡,这一假设是否真正成立?
  • RQ3在模型稳定性、性能与可解释性方面,确定性与随机掩码策略有何差异?
  • RQ4HnS 框架是否可推广至不同模态的数据,如图像、文本和结构化数据?
  • RQ5自适应损失加权在平衡准确率与可解释性双重目标中起到何种作用?

主要发现

  • HnS 框架成功实现了高达 90% 的输入特征掩码率,同时在所有测试数据集中保持了接近基线的分类准确率。
  • 本研究证明,保真度与可解释性之间的权衡是误导性的:高可解释性可在不显著损失预测性能的前提下实现。
  • 随机阈值法因掩码生成过程的平滑过渡,带来了更鲁棒、更稳定的训练,且模型间方差更低。
  • 在某些情况下(尤其是小数据集上),确定性阈值法通过偏好极端掩码解,实现了更高的可解释性。
  • 自适应损失加权方案有效平衡了双重目标,使模型能够在无需手动调整超参数的情况下收敛至最优权衡。
  • 在四个图像分类数据集上的实验表明,HnS 无需任务特定的微调即可实现良好泛化,支持其广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。