[论文解读] Inter-GPS: Interpretable Geometry Problem Solving with Formal Language and Symbolic Reasoning
本文提出了 Geometry3K,一个大规模、形式化标注的几何问题基准,包含 3,002 道 SAT 风格的问题,并提出了 Inter-GPS,一种可解释的几何问题求解器,该求解器结合形式语言解析与基于定理的条件规则进行符号推理。Inter-GPS 通过结合基于规则的文本解析器、神经图示检测与定理预测器,实现对高效、逐步推理的引导,在 Geometry3K 上达到 78.3% 的准确率,显著优于先前方法。
Geometry problem solving has attracted much attention in the NLP community recently. The task is challenging as it requires abstract problem understanding and symbolic reasoning with axiomatic knowledge. However, current datasets are either small in scale or not publicly available. Thus, we construct a new large-scale benchmark, Geometry3K, consisting of 3,002 geometry problems with dense annotation in formal language. We further propose a novel geometry solving approach with formal language and symbolic reasoning, called Interpretable Geometry Problem Solver (Inter-GPS). Inter-GPS first parses the problem text and diagram into formal language automatically via rule-based text parsing and neural object detecting, respectively. Unlike implicit learning in existing methods, Inter-GPS incorporates theorem knowledge as conditional rules and performs symbolic reasoning step by step. Also, a theorem predictor is designed to infer the theorem application sequence fed to the symbolic solver for the more efficient and reasonable searching path. Extensive experiments on the Geometry3K and GEOS datasets demonstrate that Inter-GPS achieves significant improvements over existing methods. The project with code and data is available at https://lupantech.github.io/inter-gps.
研究动机与目标
- 为解决符号推理所需的、大规模、公开可用且密集标注的几何问题数据集匮乏的问题。
- 开发一种提供透明、可解释推理路径的几何问题求解器,而非依赖隐式的神经网络表征。
- 通过将形式语言解析与符号定理应用相结合,提升几何问题求解的效率与准确率。
- 通过结合结构化输入解析与基于规则的符号推理,实现更可靠、可解释的教育类数学推理 AI 系统。
- 建立一个基准,以支持未来在可解释、符号推理方面的数学问题求解研究。
提出的方法
- Inter-GPS 使用基于规则的模板将自然语言问题文本转化为形式语言,准确率达 97%;
- 它利用神经目标检测器从图示中提取几何基本元素,并将其映射为形式语言描述;
- 该系统将几何关系与约束表示为一组结构化的形式化语句,以支持符号推理;
- 定理知识以条件规则的形式编码,并在符号推理过程中逐步应用以推导出解;
- 训练了一个定理预测器,用于预测最可能的定理应用序列,以引导搜索并降低计算成本;
- 采用结合 '预测' 与 '低优先级优先' 排序的混合搜索策略,以优先考虑可能的推理路径,将平均搜索步数减少至 7.1。
实验结果
研究问题
- RQ1大规模、形式化标注的几何数据集能否提升符号推理模型在几何问题求解中的性能与可解释性?
- RQ2对文本与图示进行形式语言解析,在实现几何问题透明、分步符号推理方面有多有效?
- RQ3定理预测器能否通过引导定理应用的序列,提升符号求解器的效率与准确率?
- RQ4与端到端神经网络模型相比,显式应用规则的符号推理在几何问题求解中能多大程度上实现性能超越?
- RQ5可解释符号求解器的主要失败模式是什么?解析错误或定理集合不完整如何影响性能?
主要发现
- Inter-GPS 在 Geometry3K 数据集上达到 78.3% 的准确率,显著优于先前的最先进方法。
- '预测+低优先级优先' 搜索策略将平均搜索步数减少至 7.1,提升了效率,同时保持了高准确率。
- 使用文本与图示的真值形式化标注可将 Inter-GPS 的准确率提升至 78.3%,证明了高质量输入表征的重要性。
- 基于规则的文本解析器准确率达 97%,而图示解析器在使用预测字面量时准确率仅为 57.5%,表明视觉解析是主要瓶颈。
- 将神经基线模型的输入替换为真值形式化标注后,性能提升 9.2%,表明结构化表征可显著提升模型性能。
- 失败案例主要源于图示解析不准确、文本中指代模糊,以及对复杂形状或着色区域的处理能力有限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。