[论文解读] RuleBERT: Teaching Soft Rules to Pre-Trained Language Models
RuleBERT 通过在包含 320 万个示例的新合成数据集上进行微调,提出了一种方法,使预训练语言模型(PLMs)能够使用带有置信度分数的软逻辑规则进行概率性、演绎性推理——即近似规则。该方法采用一种改进的损失函数,模拟概率逻辑编程(LP^MLN),使 RuleBERT 能够在未见过的规则上预测出准确的概率,在外部推理基准测试中达到最先进性能,同时将否定和对称性等逻辑概念有效迁移至模型的表征中。
While pre-trained language models (PLMs) are the go-to solution to tackle many natural language processing problems, they are still very limited in their ability to capture and to use common-sense knowledge. In fact, even if information is available in the form of approximate (soft) logical rules, it is not clear how to transfer it to a PLM in order to improve its performance for deductive reasoning tasks. Here, we aim to bridge this gap by teaching PLMs how to reason with soft Horn rules. We introduce a classification task where, given facts and soft rules, the PLM should return a prediction with a probability for a given hypothesis. We release the first dataset for this task, and we propose a revised loss function that enables the PLM to learn how to predict precise probabilities for the task. Our evaluation results show that the resulting fine-tuned models achieve very high performance, even on logical rules that were unseen at training. Moreover, we demonstrate that logical notions expressed by the rules are transferred to the fine-tuned model, yielding state-of-the-art results on external datasets.
研究动机与目标
- 为解决预训练语言模型(PLMs)在捕捉和应用常识性、逻辑推理方面存在的局限性,尤其是面对不确定(软)规则时的问题。
- 通过使 PLMs 学习近似且带置信度权重的规则,而非仅精确规则,弥合 PLMs 与逻辑推理之间的差距。
- 开发一种微调框架,使 PLMs 能够基于事实和软规则,为假设预测精确的概率。
- 评估诸如否定、对称性和复合性等逻辑概念是否能有效迁移到模型的内部表征中。
提出的方法
- 该方法将推理任务表述为二分类问题:给定事实和软规则,预测假设为真的概率。
- 构建了一个包含 320 万个示例的合成数据集,其源自从 DBpedia 中挖掘出的 161 条现实世界常识规则,目标概率通过 LP^MLN 中的形式化推理计算得出。
- 设计了一种改进的损失函数,以模拟 LP^MLN 的概率结果,使模型能够学习在多条规则间传播不确定性的能力。
- 在该合成数据上对模型进行微调,使其能够泛化到未见过的规则,并处理冲突证据。
- 该方法支持多变量规则以及涉及多条规则的复杂推理链。
- 使用知识蒸馏技术,将逻辑不变量(如否定、对称性)迁移到模型的注意力和表征层中。
实验结果
研究问题
- RQ1预训练语言模型能否被有效微调,以实现对软逻辑规则的概率演绎推理?
- RQ2经过微调的 PLM 在训练中未见过的逻辑规则上,泛化能力如何?
- RQ3模型内部表征中,逻辑不变量(如谓词否定和对称性)的迁移程度如何?
- RQ4一种模拟概率逻辑编程的改进损失函数,能否提升 PLM 在推理任务中预测的准确性和校准性?
- RQ5通过教授软规则,能否在外部推理基准测试中实现最先进性能?
主要发现
- RuleBERT 在 bAbI 任务 #15 上仅用两个训练周期就达到 0.863 的测试准确率,优于 RoBERTa 的 0.676,尤其在小样本数据集上展现出显著的泛化优势。
- 在 CheckList QQP 基准测试中,RuleBERT 经过一个训练周期后准确率达到 0.422,显著优于 RoBERTa 的 0.0,但因灾难性遗忘,从第三个周期开始出现过拟合。
- 模型能有效泛化到未见过的规则,即使仅用 20 条规则进行微调,也能保持高性能。
- RuleBERT 预测的概率与正式的 LP^MLN 推理器生成的结果非常接近,表现出极强的校准性和不确定性建模能力。
- 使用编码了对称或否定谓词的规则进行微调,可将这些逻辑不变量有效迁移到 Transformer 的低层,从而提升推理能力。
- RuleBERT 在三个外部推理数据集上实现了新的最先进结果,证实了向 PLMs 教授软规则的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。