[论文解读] The Irrationality of Neural Rationale Models
本文通过证明在极小的、语义保持不变的扰动下,神经理由模型的推理选择过程不稳定,挑战了其内在可解释性的假设。通过自动化分析和用户研究,作者表明,无论是选择器还是用户都难以理解理由的变化,从而削弱了理由作为可靠解释的说法,尤其是在CR等高精度模型中。
Neural rationale models are popular for interpretable predictions of NLP tasks. In these, a selector extracts segments of the input text, called rationales, and passes these segments to a classifier for prediction. Since the rationale is the only information accessible to the classifier, it is plausibly defined as the explanation. Is such a characterization unconditionally correct? In this paper, we argue to the contrary, with both philosophical perspectives and empirical evidence suggesting that rationale models are, perhaps, less rational and interpretable than expected. We call for more rigorous and comprehensive evaluations of these models to ensure desired properties of interpretability are indeed achieved. The code can be found at https://github.com/yimingz89/Neural-Rationale-Analysis.
研究动机与目标
- 挑战广泛持有的观点,即由于其瓶颈结构,神经理由模型本质上是可解释的。
- 调查这些模型在极小的、语义保持不变的扰动下,其理由选择过程是否稳定且可理解。
- 评估用户(包括机器学习专家)在输入发生微小修改后,是否能可靠地理解或预测理由的变化。
- 揭示选择器可能编码非透明信号的潜在故障模式,从而破坏模型的可解释性。
- 倡导对神经理由模型的可解释性主张进行更严格、系统化的评估。
提出的方法
- 作者对斯坦福情感树库(SST)数据集执行非对抗性、语义保持不变的句子扰动,以测试理由的稳定性。
- 通过两种模型分析扰动对理由选择的影响:连续松弛(CR)模型和策略梯度(PG)模型。
- 自动化分析包括跟踪理由变化的频率和位置,以及变化词语的词性(POS)构成。
- 开展一项用户研究,邀请机器学习研究生评估其在扰动前后匹配理由模式的能力,使用输入-输出示例。
- 通过统计每句话中引发理由变化的扰动数量,衡量句子间的稳定性。
- 使用反例表明,即使理由看似合理,选择器仍可能通过难以察觉的线索编码预测结果。
实验结果
研究问题
- RQ1极小的、语义保持不变的扰动是否会导致神经理由模型选择的理由发生显著且不可预测的变化?
- RQ2用户(包括专家)在输入发生微小修改后,能在多大程度上理解或预测理由的变化?
- RQ3性能-可解释性权衡是否在理由模型中显现,即高精度模型是否可解释性更差?
- RQ4理由选择过程中是否存在隐藏的、非透明的信号,从而破坏模型的可解释性?
- RQ5瓶颈结构本身是否足以保证理由作为忠实且可解释的解释?
主要发现
- CR模型在词性为‘名词’的词语上表现出37.1%的理由变化率,而PG模型在同一类别中为42.7%,表明不同模型间均存在不稳定性。
- 对于CR模型,超过70%的理由变化源于非扰动词语的替换,表明存在间接且不可预测的影响。
- PG模型中78.3%的理由变化发生在扰动词语的位置,但CR模型中仍有29.6%的变化发生在同一位置,表明变化广泛存在。
- 用户研究发现,参与者仅正确匹配了80对理由中的45对,表明其表现接近随机猜测水平,尽管参与者具备机器学习专业背景。
- 理由变化在句子间分布均匀,无少数句子主导了大部分不稳定性,表明该问题具有系统性而非孤立性。
- CR模型(准确率更高)在所有指标上均表现出更差的稳定性和可解释性,支持性能-可解释性权衡的存在。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。