[论文解读] Can Transformers Reason About Effects of Actions?
本文研究了变换器模型在合成问答数据集上,是否能够基于自然语言推理动作的影响。研究覆盖四个领域——积木世界(Blocks World)、物流(Logistics)、码头工人机器人(Dock-Worker-Robots)以及通用领域(Generic Domain)。通过答案集编程(Answer Set Programming)生成逻辑一致的情境,作者在动作影响推理任务上对变换器进行训练,发现在是/否问题和计数问题上表现强劲,且从通用领域进行迁移学习可提升零样本泛化能力,但复杂推理链上的性能有所下降。
A recent work has shown that transformers are able to "reason" with facts and rules in a limited setting where the rules are natural language expressions of conjunctions of conditions implying a conclusion. Since this suggests that transformers may be used for reasoning with knowledge given in natural language, we do a rigorous evaluation of this with respect to a common form of knowledge and its corresponding reasoning -- the reasoning about effects of actions. Reasoning about action and change has been a top focus in the knowledge representation subfield of AI from the early days of AI and more recently it has been a highlight aspect in common sense question answering. We consider four action domains (Blocks World, Logistics, Dock-Worker-Robots and a Generic Domain) in natural language and create QA datasets that involve reasoning about the effects of actions in these domains. We investigate the ability of transformers to (a) learn to reason in these domains and (b) transfer that learning from the generic domains to the other domains.
研究动机与目标
- 评估变换器是否能够学习并泛化自然语言中关于动作影响的推理,扩展先前关于合取规则推理的研究。
- 评估从通用领域到具体动作领域(积木世界、物流、DWR)的零样本迁移学习,以检验泛化能力。
- 使用答案集编程(ASP)生成并评估基于形式化动作理论的合成问答数据集,以确保逻辑一致性。
- 探究变换器在涉及动作可执行性、状态量(fluents)和状态转移的开放性问题与数值问题上的推理极限。
- 考察模型性能如何随推理复杂度变化,包括思维链(chain-of-thought)和条件效应。
提出的方法
- 使用答案集编程(ASP)生成合成动作领域,以形式化语义编码动作影响、可执行条件和状态量。
- 定义了四个领域:积木世界、物流、DWR(码头工人机器人)以及具有抽象动作和状态量的通用领域。
- 通过模拟动作序列并利用ASP求解器推导出结果状态,生成包含是/否、开放性问题和数值答案的问答数据集。
- 在每个领域的训练集上训练变换器模型(如 BERT、RoBERTa),并在未见过的测试集上进行评估。
- 通过在通用领域上微调并评估在具体领域上的表现,实现零样本迁移学习,且不再进行进一步微调。
- 使用ASP规则编码框架问题处理、惯性机制和动作前提条件,确保生成情境的逻辑一致性。
实验结果
研究问题
- RQ1当在结构化领域的合成问答数据集上进行训练时,变换器是否能够学习到在自然语言中推理动作影响的能力?
- RQ2变换器从通用领域零样本泛化到具体领域(如积木世界、物流、DWR)的效果如何?
- RQ3变换器在涉及动作链、条件效应和状态转移的复杂推理任务上的表现如何?
- RQ4不同类型的问答(是/否、开放性、数值/计数)中,模型能力有何差异?
- RQ5模型预测在多大程度上与ASP生成数据集中编码的形式语义保持逻辑一致?
主要发现
- 当在领域特定数据上进行训练时,变换器在积木世界和物流领域的是/否问题上准确率超过95%。
- 在计数问题(如“有多少台机器人被卸载?”)上,模型在DWR和通用领域中的准确率超过90%。
- 从通用领域进行零样本迁移学习,到具体领域的是/否问题上准确率达到80%–85%,表明推理模式具备部分泛化能力。
- 在涉及多个条件效应或嵌套依赖关系的复杂推理链上,性能显著下降,表明在组合泛化方面存在局限。
- 模型在简单动作影响推理任务上与ASP生成的真实答案高度一致,但在需要跟踪多个状态量随序列变化的推理中表现吃力。
- 通用领域作为预训练源表现有效,相比随机初始化能实现更好的零样本迁移,但性能仍低于微调后的领域特定模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。