[论文解读] Inducing Causal Structure for Interpretable Neural Networks
本文提出可微的互换干预训练(Interchange Intervention Training, IIT),一种将神经网络表征与符号因果模型对齐的方法,以在训练过程中强制实现反事实行为。IIT 确保神经模型不仅在下游任务中表现优异,还能实现预期的因果结构,在视觉、语言和推理任务中,其准确率与可解释性均优于多任务学习和数据增强方法。
In many areas, we have well-founded insights about causal structure that would be useful to bring into our trained models while still allowing them to learn in a data-driven fashion. To achieve this, we present the new method of interchange intervention training (IIT). In IIT, we (1) align variables in a causal model (e.g., a deterministic program or Bayesian network) with representations in a neural model and (2) train the neural model to match the counterfactual behavior of the causal model on a base input when aligned representations in both models are set to be the value they would be for a source input. IIT is fully differentiable, flexibly combines with other objectives, and guarantees that the target causal model is a causal abstraction of the neural model when its loss is zero. We evaluate IIT on a structural vision task (MNIST-PVR), a navigational language task (ReaSCAN), and a natural language inference task (MQNLI). We compare IIT against multi-task training objectives and data augmentation. In all our experiments, IIT achieves the best results and produces neural models that are more interpretable in the sense that they more successfully realize the target causal model.
研究动机与目标
- 将经验证实的因果知识整合进神经网络,同时保留数据驱动的学习能力。
- 解决现有可解释性方法仅分析已训练模型、而无法主动塑造其结构的局限性。
- 开发一种训练目标,确保当优化收敛时,神经模型能实现目标因果模型。
- 评估强制实施因果结构是否能提升系统性泛化能力与模型可解释性。
- 将 IIT 与多任务学习和数据增强方法在行为表现与因果保真度方面进行比较。
提出的方法
- IIT 将符号因果模型 C 中的变量与神经网络 N 中的表征对齐。
- 通过执行‘互换干预’——在输入之间交换内部状态——使 N 的训练过程匹配 C 的反事实行为,并以 C 的输出作为真实标签。
- 训练目标是最小化输入对之间神经模型干预输出与因果模型反事实输出之间的交叉熵。
- 该方法完全可微,可与其他目标(如多任务学习或数据增强)结合使用。
- 通过基于干预的监督强制实施因果结构,使模型在对对齐表征进行反事实扰动时能保持一致响应。
- 该方法可保证:当损失为零时,因果模型是神经网络的因果抽象(Beckers & Halpern, 2019)
实验结果
研究问题
- RQ1我们能否在保持高性能的同时,训练神经网络以实现预设的符号因果结构?
- RQ2通过 IIT 强制实施因果结构是否能带来优于标准训练或数据增强的系统性泛化能力?
- RQ3在行为准确率与可解释性方面,IIT 与多任务学习和数据增强相比表现如何?
- RQ4IIT 是否能灵活地与其他训练目标结合,以进一步提升模型性能与结构?
- RQ5IIT 在多大程度上确保神经模型的内部表征反映预期的因果抽象?
主要发现
- 在 MQNLI 任务中,IIT 达到了近似完美的行为准确率(≈100%)和互换干预准确率(≈100%),表明其与目标因果模型高度对齐。
- 数据增强方法虽达到近似完美的行为准确率,但互换干预准确率仅为 30–40%,表明其无法生成可解释的模型。
- 将多任务学习与 IIT 结合可进一步提升性能,表明二者具有协同增益。
- 将 QPObj 与 BERT 的第 6 层及以后的层对齐,取得了最佳结果,行为准确率与干预准确率均较高。
- 在 ReaSCAN 和 MNIST-PVR 任务中,IIT 在系统性泛化与因果保真度方面均优于多任务学习与数据增强基线。
- IIT 在多种任务中成功诱导出预期的因果结构,证明其在构建可解释神经网络方面的通用性与有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。