Skip to main content
QUICK REVIEW

[论文解读] Compositional Processing Emerges in Neural Networks Solving Math Problems

Jacob Russin, Roland Fernandez|arXiv (Cornell University)|May 19, 2021
Natural Language Processing Techniques参考文献 13被引用 21
一句话总结

本文研究神经网络在解决数学问题时是否通过组合性处理——即把表达式分解为子组件,计算其值,并根据规则(如运算顺序)组合结果。通过对在 Mathematics Dataset 上训练的 Transformer 模型进行激活分析,作者发现运算符位置出现了部分结果的表征,表明模型在没有显式架构设计的情况下,隐式学习并应用了组合语义。

ABSTRACT

A longstanding question in cognitive science concerns the learning mechanisms underlying compositionality in human cognition. Humans can infer the structured relationships (e.g., grammatical rules) implicit in their sensory observations (e.g., auditory speech), and use this knowledge to guide the composition of simpler meanings into complex wholes. Recent progress in artificial neural networks has shown that when large models are trained on enough linguistic data, grammatical structure emerges in their representations. We extend this work to the domain of mathematical reasoning, where it is possible to formulate precise hypotheses about how meanings (e.g., the quantities corresponding to numerals) should be composed according to structured rules (e.g., order of operations). Our work shows that neural networks are not only able to infer something about the structured relationships implicit in their training data, but can also deploy this knowledge to guide the composition of individual meanings into composite wholes.

研究动机与目标

  • 研究在数学应用题上训练的神经网络是否隐式学习并应用组合语义,类似于人类认知。
  • 确定模型是否将算术表达式分解为子组件,计算其值,并通过结构化规则(如运算顺序)组合结果。
  • 评估标准 Transformer 和 TP-Transformer 中是否在无显式组合性架构支持的情况下,自然涌现出组合性处理。
  • 评估学习到的表征在多大程度上编码了部分结果,特别是运算符位置。
  • 理解涌现组合性对神经网络泛化能力和系统性推理的启示。

提出的方法

  • 在 Mathematics Dataset 上训练标准 Transformer 和 TP-Transformer,该数据集包含跨多个领域的 1.12 亿道数学应用题。
  • 通过分析输入序列中隐藏状态激活值,执行表征探测,以检测部分结果(如子表达式的值)何时以及在何处被编码。
  • 使用隐藏状态与预期部分结果(如 '4*5' 对应的 20)之间的相关性分析,识别与子表达式值对齐的表征。
  • 聚焦于运算符位置,检验其是否编码了运算结果(如 '+' 或 '*' 位置编码操作数的和或积)。
  • 在完整输入序列上重新计算相关性,以评估构成符号(如数字和运算符)是否也携带其子表达式值的信息。
  • 比较标准 Transformer 与 TP-Transformer 的结果,以评估张量积表征对组合学习的影响。

实验结果

研究问题

  • RQ1在数学问题上训练的神经网络是否隐式学习将表达式分解为子组件并组合计算其值?
  • RQ2部分结果的表征是否编码在 Transformer 的隐藏状态中,特别是在运算符位置?
  • RQ3标准 Transformer 和 TP-Transformer 在表征组合语义方面的能力差异有多大?
  • RQ4部分结果表征的存在是否与分布外问题上的泛化能力提升相关?
  • RQ5神经网络中涌现的组合性处理能否与系统性推理和组合泛化联系起来?

主要发现

  • 在标准和 TP-Transformer 模型中,运算符位置的隐藏状态表征与子表达式数值值表现出强烈相关性(例如,在 '4*5+2*3' 上,TP-Transformer 的 r = 0.47)。
  • 构成符号(如数字和运算符)的表征也携带其子表达式值的信息,部分结果的相关性分别为 r = 0.201(TP)和 r = 0.189(标准)。
  • 隐藏状态与部分结果之间的相关性在运算符位置达到峰值,表明这些位置编码了中间计算的结果。
  • 尽管有强有力的组合性处理证据,但相关性并非完美,表明表征编码的不仅是数量,还可能包括构成结构和上下文信息。
  • 模型在外推任务(如更大数字、更多项)上的泛化能力较差,表明涌现的组合性是不完善的,不足以实现完全的系统性泛化。
  • 结果表明,即使没有显式组合性架构支持,神经网络在大规模多样化数据上训练时,仍会自然涌现出组合性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。