[论文解读] Learning Credible Deep Neural Networks with Rationale Regularization
本文提出 CREX,一种通过正则化方法使深度神经网络(DNNs)聚焦于专家提供的推理过程(即对预测至关重要的关键特征),从而减少对数据集中虚假偏差的依赖,提升模型可信度。实验表明,CREX 在未见数据上提升了泛化能力,即使在保留测试集上的准确率保持不变。
Recent explainability related studies have shown that state-of-the-art DNNs do not always adopt correct evidences to make decisions. It not only hampers their generalization but also makes them less likely to be trusted by end-users. In pursuit of developing more credible DNNs, in this paper we propose CREX, which encourages DNN models to focus more on evidences that actually matter for the task at hand, and to avoid overfitting to data-dependent bias and artifacts. Specifically, CREX regularizes the training process of DNNs with rationales, i.e., a subset of features highlighted by domain experts as justifications for predictions, to enforce DNNs to generate local explanations that conform with expert rationales. Even when rationales are not available, CREX still could be useful by requiring the generated explanations to be sparse. Experimental results on two text classification datasets demonstrate the increased credibility of DNNs trained with CREX. Comprehensive analysis further shows that while CREX does not always improve prediction accuracy on the held-out test set, it significantly increases DNN accuracy on new and previously unseen data beyond test set, highlighting the advantage of the increased credibility.
研究动机与目标
- 解决深度神经网络(DNNs)缺乏可信度的问题,这些模型常依赖虚假特征或偏差特征,而非正确证据。
- 通过确保 DNNs 聚焦于与领域知识一致的语义相关特征,提升模型泛化能力。
- 开发一种训练正则化方法,利用专家推理指导注意力机制,无需大规模微调或架构修改。
- 评估在预测中引入高质量推理是否能提升 DNN 的鲁棒性与可信度,特别是在分布外数据上。
- 评估该方法在低质量推理标注(如含噪声或不完整的专家推理)下的鲁棒性。
提出的方法
- CREX 引入一种基于推理的正则化损失,促使模型的局部解释(注意力权重)与专家提供的推理对齐——具体而言,即突出显示为预测关键的输入特征子集。
- 该方法使用可微分注意力机制计算每个输入的局部解释,支持通过解释生成过程进行端到端反向传播。
- 应用对比正则化损失,以最小化模型解释向量与专家推理向量之间的距离,从而在训练过程中促进对齐。
- 当缺乏专家推理时,CREX 仍强制解释向量的稀疏性,促使模型聚焦于最小且有意义的特征子集。
- 该方法与网络架构无关,兼容多种 DNN 模型(包括 CNNs),可仅通过少量修改集成至标准训练流程。
- 通过稀疏推理采样与优化技术,保持训练效率,且推理速度与原始 DNN 保持一致。
实验结果
研究问题
- RQ1在 DNN 训练中引入专家提供的推理是否能通过引导注意力聚焦于相关特征,从而提升模型可信度?
- RQ2即使保留测试集准确率未提升,基于推理的正则化是否仍能提升模型在分布外数据上的泛化能力?
- RQ3CREX 对低质量推理(如含标注错误或关键特征缺失)的鲁棒性如何?
- RQ4CREX 是否能在提升模型可信度与解释质量的同时,保持高推理速度?
- RQ5基于推理的正则化在多大程度上减少了 DNN 预测中对数据集特异性偏差与伪影的依赖?
主要发现
- 使用 CREX 训练的 DNN 在未见过的新数据上表现出显著提升的泛化性能,表明其可信度与鲁棒性更高。
- 在 CNN 模型上,CREX 在 Kaggle 数据集上实现了比原始 DNN 高 4.2% 的泛化准确率,在 Polarity 数据集上提升了 3.8%,尽管保留测试集准确率未提升。
- 模型性能对推理噪声高度敏感——仅 10% 的推理错误率就导致泛化准确率显著下降,表明高质量专家输入至关重要。
- 相比之下,模型对缺失推理的鲁棒性较强,即使高达 50% 的关键特征被遗漏,仍能保持强劲性能。
- CREX 训练平均耗时约 18.1 分钟(原始 CNN 为 2.5 分钟),但推理时间保持不变,为每输入 8e-3 秒,确保了部署效率。
- 即使仅使用少量推理,该方法仍有效,表明其在标注成本有限的场景下具有实际应用潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。