Skip to main content
QUICK REVIEW

[论文解读] Counterfactual Variable Control for Robust and Interpretable Question Answering

Sicheng Yu, Yulei Niu|arXiv (Cornell University)|Oct 12, 2020
Topic Modeling参考文献 54被引用 6
一句话总结

本文提出反事实变量控制(CVC),一种新颖方法,通过使用因果推断显式解耦综合推理与捷径相关性,以提升阅读理解任务的鲁棒性与可解释性。通过利用多分支神经网络架构与反事实推理,CVC 在基于 BERT 的阅读理解基准上实现了对抗攻击下的最先进鲁棒性,同时保持了模型的可解释性。

ABSTRACT

Deep neural network based question answering (QA) models are neither robust nor explainable in many cases. For example, a multiple-choice QA model, tested without any input of question, is surprisingly "capable" to predict the most of correct options. In this paper, we inspect such spurious "capability" of QA models using causal inference. We find the crux is the shortcut correlation, e.g., unrobust word alignment between passage and options learned by the models. We propose a novel approach called Counterfactual Variable Control (CVC) that explicitly mitigates any shortcut correlation and preserves the comprehensive reasoning for robust QA. Specifically, we leverage multi-branch architecture that allows us to disentangle robust and shortcut correlations in the training process of QA. We then conduct two novel CVC inference methods (on trained models) to capture the effect of comprehensive reasoning as the final prediction. For evaluation, we conduct extensive experiments using two BERT backbones on both multi-choice and span-extraction QA benchmarks. The results show that our CVC achieves high robustness against a variety of adversarial attacks in QA while maintaining good interpretation ability.

研究动机与目标

  • 探究为何最先进阅读理解模型尽管准确率高,却表现出较差的鲁棒性且缺乏可解释性。
  • 识别捷径相关性(如篇章与选项之间的词语对齐)作为模型脆弱性的根本原因。
  • 开发一种方法,显式缓解捷径相关性,同时保留综合推理能力,以实现鲁棒且可解释的阅读理解。
  • 在多种阅读理解基准上,使用多样化的 BERT 主干网络,在对抗性与域内设置下验证该方法。

提出的方法

  • CVC 采用多分支神经网络架构,包含一个鲁棒推理分支与多个捷径分支,以在训练过程中解耦推理与虚假相关性。
  • 该方法使用反事实分析,模拟移除某一变量(如问题)的影响,以隔离综合推理的贡献。
  • 提出两种推理方法:CVC-IV(基于干预)与 CVC-MV(基于均值变异),两者均旨在通过减去受捷径影响的预测,估计推理的间接效应。
  • CVC-IV 通过掩码推理表征并从正常预测中减去,计算反事实预测,以隔离推理效应。
  • CVC-MV 使用可学习的控制机制调节捷径分支的影响,损失函数通过概率分布之间的距离度量,鼓励解耦。
  • 该方法以多任务方式训练,在保留标准监督学习的同时,实现在推理阶段的反事实推断。

实验结果

研究问题

  • RQ1预训练阅读理解模型为何会出现鲁棒性失效,尤其是在无任何问题输入时仍表现良好的情况下?
  • RQ2如何利用因果推断,正式地在阅读理解模型中分离综合推理与捷径相关性?
  • RQ3反事实推理能否在保持标准基准高准确率的同时,提升模型对对抗攻击的鲁棒性?
  • RQ4推理与捷径组件的解耦如何影响模型在分布偏移下的可解释性与性能?

主要发现

  • CVC 在对抗性基准上达到最先进鲁棒性,在 MCTest 数据集上使用 BERT-base 时,Adv1 准确率为 56.3%,Adv2 为 66.2%。
  • 在域内开发集上,CVC-IV 在 MCTest 上达到 86.6% 准确率,在 SQuAD 上达到 87.2%,优于基线模型。
  • 消融研究显示,若移除捷径分支或使用替代距离度量,性能下降,证实了完整 CVC 机制的重要性。
  • CVC-MV 在域内数据上的表现优于 CVC-IV,表明在多样化数据上训练时,可学习控制机制能提升泛化能力。
  • 案例研究显示,即使词语对齐捷径误导标准模型,CVC 仍能正确识别正确答案。
  • 该方法在标准基准上保持高性能,同时显著降低对虚假相关性的依赖,表现为对问题屏蔽攻击的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。