[论文解读] Self-explaining deep models with logic rule reasoning
本文提出 SELOR,一种自解释深度学习框架,通过整合逻辑规则推理,生成与人类决策逻辑一致的、高精度的人类可理解解释,同时保持高预测性能。通过端到端可微分地学习可解释的逻辑规则,无需人工标注的推理过程,SELOR 在多样化输入下实现了忠实、稳定且语义连贯的解释。
We present SELOR, a framework for integrating self-explaining capabilities into a given deep model to achieve both high prediction performance and human precision. By "human precision", we refer to the degree to which humans agree with the reasons models provide for their predictions. Human precision affects user trust and allows users to collaborate closely with the model. We demonstrate that logic rule explanations naturally satisfy human precision with the expressive power required for good predictive performance. We then illustrate how to enable a deep model to predict and explain with logic rules. Our method does not require predefined logic rule sets or human annotations and can be learned efficiently and easily with widely-used deep learning modules in a differentiable way. Extensive experiments show that our method gives explanations closer to human decision logic than other methods while maintaining the performance of deep learning models.
研究动机与目标
- 为解决自解释模型中缺乏人类精准解释的问题,即解释虽可解释但未与人类推理对齐。
- 开发一种方法,确保解释在全局上连贯(遵循人类逻辑形式)且在局部上连贯(对预测提供正确推理),且无需依赖人工标注的决策过程。
- 通过标准深度学习模块实现逻辑规则解释的端到端、可微分学习,避免依赖预定义规则或事后近似方法。
- 通过生成不仅忠实于模型、而且对人类直观且可操作的解释,提升用户信任与模型协作能力。
提出的方法
- 该框架学习一个可微分的逻辑规则生成器,从深度表征中生成符号化逻辑规则,实现在单次前向传播中联合预测与解释。
- 采用可微分的逻辑推理模块,对输入特征上的逻辑规则真值进行评估,支持通过逻辑运算进行反向传播。
- 通过结合预测损失与解释一致性损失的多任务目标进行训练,促进解释在模型输出与人类感知之间的一致性。
- 逻辑规则通过可学习的逻辑算子空间构建,支持灵活形式(如 AND、OR、自定义关系如 BEFORE),反映人类推理模式。
- 该方法无需预定义规则集或人工标注的推理过程,实现可扩展、数据驱动的规则发现。
- 通过确保微小输入扰动(如同义词替换)不会改变解释,除非关键特征发生变化,来增强解释的稳定性。
实验结果
研究问题
- RQ1自解释模型能否生成不仅忠实于模型,而且与人类决策逻辑对齐的解释?
- RQ2如何在无需人工标注推理过程的前提下,以可微分、端到端可训练的方式将逻辑规则整合进深度学习模型?
- RQ3在输入发生微小扰动时,模型能否保持解释的稳定性,同时对关键语义变化做出适应性响应?
- RQ4与现有事后或局部解释方法相比,使用逻辑规则是否能提升人类解释的精确度?
主要发现
- 经人类评估验证,在情感分类任务中,SELOR 生成的解释显著更接近人类决策逻辑,优于现有事后或自解释方法。
- 该模型保持了与标准深度学习模型相当的高预测性能,证明可解释性无需以牺牲准确性为代价。
- 在输入发生微小变化时(如将 'pizza' 替换为 'pasta',或将 'waiters' 替换为 'servers'),解释保持稳定;而当情感关键词改变时(如 'cold' 变为 'hot'),解释能有意义地自适应。
- 当关键情感词被修改时(如 'cold' 变为 'hot' 或 'rude' 变为 'polite'),SELOR 会生成新的、上下文恰当的逻辑规则,展现出适应性推理能力。
- 该框架实现了高人类精确度,其解释被人类标注者视为正确推理,优于线性或注意力基解释基线模型。
- 该方法成功学习到可解释的逻辑规则(如 'awful AND cold AND rude → Negative'),真实反映自然的人类推理模式,且无需预定义规则集。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。