[论文解读] Explaining Deep Neural Networks
本博士论文研究了解释深度神经网络的两个关键方向:基于特征的事后解释方法与能够生成自然语言解释的自解释模型。该研究提出了一套验证框架,用于检验事后方法的忠实性,构建了包含57万条人工撰写解释的e-SNLI数据集,并提出了一种对抗性框架,用于检测不一致的自然语言解释,揭示了当前模型中的关键缺陷。
Deep neural networks are becoming more and more popular due to their revolutionary success in diverse areas, such as computer vision, natural language processing, and speech recognition. However, the decision-making processes of these models are generally not interpretable to users. In various domains, such as healthcare, finance, or law, it is critical to know the reasons behind a decision made by an artificial intelligence system. Therefore, several directions for explaining neural models have recently been explored. In this thesis, I investigate two major directions for explaining deep neural networks. The first direction consists of feature-based post-hoc explanatory methods, that is, methods that aim to explain an already trained and fixed model (post-hoc), and that provide explanations in terms of input features, such as tokens for text and superpixels for images (feature-based). The second direction consists of self-explanatory neural models that generate natural language explanations, that is, models that have a built-in module that generates explanations for the predictions of the model.
研究动机与目标
- 调查基于特征的事后解释方法在忠实反映模型决策过程方面的局限性。
- 开发一种通用框架,利用模型可解释性见解验证不同任务和模型的事后解释方法的忠实性。
- 收集并分析大规模人类撰写的自然语言推理任务中的自然语言解释数据集。
- 识别并检测自解释神经模型生成的不一致自然语言解释。
- 提出一种对抗性框架,专门针对序列到序列解释生成中的精确序列级不一致性。
提出的方法
- 提出一种验证框架,利用特定类别的可解释模型,测试事后解释方法是否准确反映目标模型的决策过程。
- 将验证框架应用于情感分析任务,通过合理性测试评估三种主流解释方法(如Grad-CAM、LIME、LRP)。
- 通过收集约57万条针对SNLI数据集的人工撰写自然语言解释,构建e-SNLI数据集,并为其添加解释模板。
- 识别可重用的解释模板(蕴涵、中性、矛盾),以系统化地生成用于对抗性测试的不一致解释对。
- 设计一种对抗性攻击框架,生成精确的目标序列以触发不一致的解释(例如,对同一张图像同时生成“有一只狗”和“没有狗”)。
- 将对抗性框架应用于e-SNLI上的最先进模型,证明其能够生成大量不一致的解释。
实验结果
研究问题
- RQ1对于单一预测,是否存在多种有效的基于特征的真值解释?当前的事后方法是否在无意中针对不同类型的解释?
- RQ2我们能否开发一种通用的、即插即用的框架,以验证不同任务和模型中事后解释方法的忠实性?
- RQ3神经模型在多大程度上能够生成正确且一致的自然语言解释以支持其预测?
- RQ4训练阶段的自然语言解释在多大程度上影响模型在测试阶段生成忠实解释的能力?
- RQ5能否设计出对抗性攻击,以生成精确的、不一致的自然语言解释?这类不一致性在最先进模型中有多普遍?
主要发现
- 事后解释方法常常在未明确承认的情况下,针对不同类型的真实解释,且没有任何单一解释能完全捕捉模型的决策过程。
- 所提出的验证框架成功识别出主流解释方法的忠实性问题,合理性测试代码已公开于 https://github.com/OanaMariaCamburu/CanITrustTheExplainer。
- e-SNLI数据集已公开发布于 https://github.com/OanaMariaCamburu/e-SNLI,包含约57万条针对SNLI数据集的人工撰写自然语言解释。
- 实验表明,当前的自解释模型可能生成不一致的解释,例如在同一张图像中同时声称存在和不存在某个物体。
- 对抗性框架在最先进模型中检测到大量不一致的解释,证明此类缺陷普遍存在且可被检测。
- 研究表明,即使经过解释监督训练的模型,仍可能生成矛盾的解释,凸显了在解释生成中进行鲁棒性检查的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。