[论文解读] Weakly Supervised Explainable Phrasal Reasoning with Neural Fuzzy Logic
本文提出可解释短语推理(EPR),一种弱监督的神经模糊逻辑模型,用于自然语言蕴涵(NLI)任务,能够检测短语级别的逻辑关系(蕴涵、矛盾、中性),并通过可微分模糊逻辑推导出句子级别的标签。该模型在e-SNLI数据集上实现了文本解释生成的最先进性能,仅使用模型生成的推理过程,无需人工标注的高亮,BLEU得分提升了2分。
Natural language inference (NLI) aims to determine the logical relationship between two sentences, such as Entailment, Contradiction, and Neutral. In recent years, deep learning models have become a prevailing approach to NLI, but they lack interpretability and explainability. In this work, we address the explainability of NLI by weakly supervised logical reasoning, and propose an Explainable Phrasal Reasoning (EPR) approach. Our model first detects phrases as the semantic unit and aligns corresponding phrases in the two sentences. Then, the model predicts the NLI label for the aligned phrases, and induces the sentence label by fuzzy logic formulas. Our EPR is almost everywhere differentiable and thus the system can be trained end to end. In this way, we are able to provide explicit explanations of phrasal logical relationships in a weakly supervised manner. We further show that such reasoning results help textual explanation generation.
研究动机与目标
- 通过引入弱监督推理机制,解决基于深度学习的NLI模型可解释性不足的问题。
- 实现前提与假设短语之间的显式、人类可理解的短语级逻辑关系(例如,蕴涵、矛盾)。
- 利用可微分模糊逻辑公式,从短语级预测推导出句子级NLI标签。
- 证明自动提取的短语级推理能够提升NLI文本解释生成的质量,且无需依赖人工标注的推理过程。
- 构建一个新的短语推理基准,包含人工标注的标签和评估指标
提出的方法
- 使用神经短语切分器检测前提和假设中的语义短语,随后进行基于嵌入的短语对齐。
- 训练一个可微分的短语预测器,将每对对齐的短语分类为三种NLI关系之一:蕴涵、矛盾或中性。
- 使用神经模糊逻辑将短语级预测聚合为句子级NLI标签,支持端到端训练。
- 仅使用句子级NLI标签进行弱监督训练,避免昂贵的短语级标注。
- 利用预测的短语级逻辑关系作为事实知识,用于条件化序列到序列文本生成模型,以生成解释。
- 设计一个综合评估框架,包含人工标注的短语级标签和评估指标,以评估推理质量
实验结果
研究问题
- RQ1仅使用句子级NLI标签而无需短语级标注,能否有效训练弱监督的短语级推理?
- RQ2神经模糊逻辑能否提供一种可微分且可解释的机制,将短语级预测聚合为句子级标签?
- RQ3提取的短语级逻辑推理是否能提升NLI中生成的文本解释的质量?
- RQ4EPR在短语级推理和下游解释生成任务中的性能与强基线相比如何?
- RQ5EPR自动生成的短语级推理过程是否能在解释生成中超越人工标注的高亮?
主要发现
- 与竞争模型相比,EPR在短语级推理任务上(以人工标注标签为基准)取得了显著更高的F1分数,证明其在捕捉有意义的逻辑关系方面的有效性。
- 该模型在e-SNLI数据集上实现了42.63的全新SOTA BLEU分数,用于仅使用EPR生成的短语级推理过程的文本解释生成任务,比使用人工标注高亮的模型高出2分。
- 使用EPR进行微调的64M参数T5-small模型在解释质量上超越了更大的模型(220M和11B参数),表明高质量推理信号具有重要价值。
- 模型中使用全局特征会导致更高的句子级准确率,但推理性能下降,凸显了预测准确率与有意义推理之间的权衡。
- 在受控实验中,EPR模型的短语级推理输出比人工标注的高亮提供了更有价值的信息,表现为与相同设置下使用人工标注推理过程相比,BLEU得分高出2分。
- 消融实验确认,使用全局特征的平均聚合方法虽能达到高句子级准确率,但无法学习到有意义的短语级推理,突显了显式推理组件的重要性
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。