Skip to main content
QUICK REVIEW

[论文解读] RobustLR: Evaluating Robustness to Logical Perturbation in Deductive Reasoning

Soumya Sanyal, Zeyi Liao|arXiv (Cornell University)|May 25, 2022
Natural Language Processing Techniques被引用 5
一句话总结

本文提出了 RobustLR,一个用于评估语言模型在演绎推理任务中逻辑鲁棒性的诊断基准。通过在合成的理论-语句对中施加最小的逻辑扰动(如合取、析取,尤其是否定的改变),研究发现 RoBERTa、T5 和 GPT-3 等模型在泛化方面表现不一致,尤其是在否定操作上,表明尽管经过推理数据集的微调,这些模型仍缺乏真正的逻辑理解能力。

ABSTRACT

Transformers have been shown to be able to perform deductive reasoning on a logical rulebase containing rules and statements written in English natural language. While the progress is promising, it is currently unclear if these models indeed perform logical reasoning by understanding the underlying logical semantics in the language. To this end, we propose RobustLR, a suite of evaluation datasets that evaluate the robustness of these models to minimal logical edits in rulebases and some standard logical equivalence conditions. In our experiments with RoBERTa and T5, we find that the models trained in prior works do not perform consistently on the different perturbations in RobustLR, thus showing that the models are not robust to the proposed logical perturbations. Further, we find that the models find it especially hard to learn logical negation and disjunction operators. Overall, using our evaluation sets, we demonstrate some shortcomings of the deductive reasoning-based language models, which can eventually help towards designing better models for logical reasoning over natural language. All the datasets and code base have been made publicly available.

研究动机与目标

  • 探究语言模型是否真正理解逻辑运算符,还是在演绎推理中依赖虚假相关性。
  • 开发一个诊断基准,用于测试输入语句和规则在最小逻辑编辑下的鲁棒性。
  • 评估模型在基于形式逻辑等价性的逻辑同义表达中是否能一致地泛化。
  • 识别推理模型中的系统性失败,特别是关于逻辑否定和运算符语义方面的问题。
  • 提供一个公开基准,以指导未来更具有逻辑鲁棒性的推理模型的开发。

提出的方法

  • 设计一个诊断基准 RobustLR,包含两个评估集:逻辑对比集和逻辑等价集。
  • 通过在规则中施加最小的逻辑扰动(例如,将 'and' 替换为 'or',或添加否定)来构建逻辑对比集,同时保持语义意义不变。
  • 利用形式逻辑等价性(例如,德摩根定律)构建逻辑等价集,生成具有相同真值条件的改写规则。
  • 在现有演绎推理数据集上微调 RoBERTa、T5 和 GPT-3,然后在 RobustLR 的测试集上评估其性能。
  • 在评估过程中过滤掉 'Unknown' 预测结果,以隔离模型在明确蕴含或矛盾语句上的表现。
  • 将模型在 RobustLR 上的表现与分布内数据和人类表现进行对比,以衡量鲁棒性差距。

实验结果

研究问题

  • RQ1在演绎推理数据集上训练的语言模型能否对输入规则和语句中的最小逻辑扰动实现稳健的泛化?
  • RQ2当使用形式逻辑等价性改变表面形式但保留真值条件时,模型在逻辑同义表达上的表现如何?
  • RQ3训练数据中的虚假统计相关性在多大程度上导致了语言模型推理行为的非鲁棒性?
  • RQ4为何模型在逻辑否定方面表现出特别困难,而合取和析取则相对容易?
  • RQ5模型与人类在 RobustLR 上的表现差距是由于数据中的虚假性,还是模型在学习逻辑语义方面存在固有的局限性?

主要发现

  • 在演绎推理数据集上微调的语言模型在 RobustLR 的逻辑对比集和逻辑等价集上均表现出显著的性能下降,表明其对逻辑扰动的鲁棒性较差。
  • 即使在过滤掉 'Unknown' 预测后,分布内与分布外(扰动)数据之间的性能差距仍维持在约 15%,表明存在内在的学习局限性,而不仅仅是数据稀疏性问题。
  • 模型在逻辑否定方面表现出特别困难,即使逻辑含义保持不变,也始终无法在否定形式之间实现泛化。
  • 更大的模型如 T5-11B 虽然性能有所提升,但仍低于人类水平的准确率,表明规模本身并不能解决逻辑鲁棒性问题。
  • 失败并非仅仅由虚假相关性引起,因为即使在标签分布均匀且统计偏差被最小化的情况下,性能差距依然存在。
  • RobustLR 揭示了当前语言模型在逻辑推理中缺乏系统性泛化能力,尤其是在否定和等价变换等复杂逻辑操作方面。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。