[论文解读] Weakly Supervised Neuro-Symbolic Module Networks for Numerical Reasoning
该论文提出弱监督神经符号模块网络(WNSMN),一种用于机器阅读理解中数值推理的框架,仅使用答案监督即可端到端训练。它从查询的依存句法解析中构建噪声启发式程序,通过神经模块和符号模块的离散动作执行程序,并利用强化学习与离散奖励进行优化,在弱监督设置下,DROP数据集上的精确匹配率比NMN高出32%,比GenBERT高出8%。
Neural Module Networks (NMNs) have been quite successful in incorporating explicit reasoning as learnable modules in various question answering tasks, including the most generic form of numerical reasoning over text in Machine Reading Comprehension (MRC). However, to achieve this, contemporary NMNs need strong supervision in executing the query as a specialized program over reasoning modules and fail to generalize to more open-ended settings without such supervision. Hence we propose Weakly-Supervised Neuro-Symbolic Module Network (WNSMN) trained with answers as the sole supervision for numerical reasoning based MRC. It learns to execute a noisy heuristic program obtained from the dependency parsing of the query, as discrete actions over both neural and symbolic reasoning modules and trains it end-to-end in a reinforcement learning framework with discrete reward from answer matching. On the numerical-answer subset of DROP, WNSMN out-performs NMN by 32% and the reasoning-free language model GenBERT by 8% in exact match accuracy when trained under comparable weak supervised settings. This showcases the effectiveness and generalizability of modular networks that can handle explicit discrete reasoning over noisy programs in an end-to-end manner.
研究动机与目标
- 解决现有神经模块网络(NMN)在程序执行和黄金程序注释方面需要强监督的局限性。
- 实现在无细粒度监督的情况下,仅依赖答案匹配作为奖励信号,对神经符号推理模块进行端到端训练。
- 通过从依存句法解析中学习噪声启发式程序,提升开放性数值推理任务中的泛化能力。
- 证明在弱监督设置下,对符号模块进行显式离散推理可优于纯神经网络或混合模型。
提出的方法
- 从问题的依存句法树中构建噪声启发式程序,通过自左向右遍历形成包含查询片段和参考参数的程序步骤。
- 采用神经符号框架,其中每个程序步骤对应一个离散推理操作(如最大值、计数)作用于实体(日期/数字)的神经嵌入。
- 采用基于答案正确性的离散奖励的强化学习目标,通过超参数λ的凸组合策略实现保守与非保守的动作选择。
- 为操作符、实体类型和参数采样模块引入噪声伪奖励,通过在可能正确输出上的负对数似然实现辅助监督。
- 应用交叉注意力机制,将篇章中特定实体的表示(日期/数字)进行对齐,以提升对符号参数的推理能力。
- 采用迭代最大似然(IML)目标,在稀疏奖励设置下稳定训练,通过类似ε-greedy的行为平衡探索与利用。
实验结果
研究问题
- RQ1在无黄金程序或执行轨迹的情况下,神经符号模块网络能否在仅使用答案监督的条件下实现强大的数值推理MRC性能?
- RQ2从依存句法解析中衍生的噪声启发式程序在弱监督设置下的推理基础是否有效?
- RQ3当与神经实体表示结合时,能否通过强化学习有效学习离散符号操作(如最大值、计数)?
- RQ4仅使用答案奖励的端到端训练是否比需要程序结构或执行步骤强监督的模型泛化能力更强?
- RQ5来自可能正确动作的伪奖励信号是否能提升稀疏奖励环境下的训练稳定性和性能?
主要发现
- 在弱监督设置下,WNSMN在DROP数据集上的精确匹配准确率相比神经模块网络(NMN)相对提升了32%。
- WNSMN在精确匹配准确率上比无推理的预训练语言模型GenBERT高出8%,证明即使仅使用答案监督,显式符号推理仍具优势。
- 由于能够从依存句法解析中衍生的噪声启发式程序中学习,该模型在强监督不可用的开放性设置中表现出良好的泛化能力。
- 为操作符、实体类型和参数采样模块引入的噪声伪奖励显著提升了训练稳定性和性能,尤其在稀疏奖励环境中效果明显。
- 采用低λ值的迭代最大似然(IML)目标能有效平衡探索与利用,减少训练过程中的过拟合和局部极小值问题。
- 该框架无需预先计算所有输出,即可成功处理复杂数值操作(如最大值、计数),与混合模型相比具有优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。