Skip to main content
QUICK REVIEW

[论文解读] Combining Symbolic Expressions and Black-box Function Evaluations in Neural Programs

Forough Arabshahi, Sameer Singh|arXiv (Cornell University)|Jan 12, 2018
Machine Learning and Data Classification被引用 9
一句话总结

本文提出了一种新颖的神经程序框架,通过树LSTM结合符号表达式与黑箱函数评估,以提升数学方程学习中的泛化能力。通过联合建模符号结构与数值函数输出,该模型在方程验证与补全任务上达到最先进性能,即使在训练数据有限的情况下,也能有效泛化到未见过的表达式与数值。

ABSTRACT

Neural programming involves training neural networks to learn programs, mathematics, or logic from data. Previous works have failed to achieve good generalization performance, especially on problems and programs with high complexity or on large domains. This is because they mostly rely either on black-box function evaluations that do not capture the structure of the program, or on detailed execution traces that are expensive to obtain, and hence the training data has poor coverage of the domain under consideration. We present a novel framework that utilizes black-box function evaluations, in conjunction with symbolic expressions that define relationships between the given functions. We employ tree LSTMs to incorporate the structure of the symbolic expression trees. We use tree encoding for numbers present in function evaluation data, based on their decimal representation. We present an evaluation benchmark for this task to demonstrate our proposed model combines symbolic reasoning and function evaluation in a fruitful manner, obtaining high accuracies in our experiments. Our framework generalizes significantly better to expressions of higher depth and is able to fill partial equations with valid completions.

研究动机与目标

  • 解决现有神经程序模型仅依赖黑箱函数评估或详细执行轨迹时泛化能力差的问题。
  • 利用符号表达式——表示函数与变量之间结构关系——并结合黑箱函数评估,以提升模型泛化能力。
  • 设计一种可扩展、灵活的架构,通过符号表达式树之间的参数共享,实现对多个数学函数的同时学习。
  • 开发一种数据生成策略,确保在训练过程中对符号恒等式与函数评估实现均衡且全面的覆盖。
  • 在三角函数与初等代数的方程验证与补全任务上评估该框架,展示其优越性能与泛化能力。

提出的方法

  • 使用树LSTM编码符号表达式树,通过在相同函数间共享参数,实现对多个数学函数的联合学习。
  • 扩展树LSTM以处理来自黑箱函数评估的数值输入,通过其十进制表示编码数字。
  • 采用混合训练目标,同时包含符号恒等式验证与函数评估预测。
  • 在推理阶段应用数字的树编码,以实现对未见过的数值的泛化。
  • 设计数据生成流水线,生成多样化的符号恒等式及其对应的函数评估对,并实现均衡覆盖。
  • 采用top-k准确率与top-k最小MSE作为方程补全的评估指标,以区分符号与函数评估任务。

实验结果

研究问题

  • RQ1将符号表达式与黑箱函数评估相结合,是否能在神经程序学习中实现比单独使用任一模态更好的泛化效果?
  • RQ2具有树结构编码的神经模型,能否在测试数据中未出现的数学表达式与数值上实现良好泛化?
  • RQ3引入符号结构是否能提升模型在方程补全与验证任务上的性能,相比序列模型或非树结构模型?
  • RQ4所提出的生成策略在多大程度上确保了对领域内内容的均衡与全面覆盖?
  • RQ5该模型能否在不同数学领域(如三角函数与代数)之间实现知识迁移,且学习到的表征是否具有有意义的聚类特性?

主要发现

  • 所提出的结合符号与函数评估输入的树LSTM模型,在方程补全任务上的top-1准确率显著高于仅使用函数评估数据或仅使用符号数据的模型。
  • 树结构模型,特别是树LSTM,在方程验证与补全任务中均优于序列模型,证明了建模组合结构的重要性。
  • 模型能有效泛化到未见过的数值与符号表达式,表现为对先前未见值与结构的预测具有高置信度。
  • 在函数评估任务中,树LSTM在所有k值下均取得比树神经网络(Tree NN)更低的top-k最小MSE,表明其预测更准确且置信度更高。
  • 在符号方程补全任务中,模型能以高置信度生成多个正确候选解;在函数评估任务中,能正确识别唯一正确值。
  • 符号表达式与函数评估的融合带来了显著的性能提升,尤其在k=1时表现突出,凸显了两种数据类型的互补性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。