[论文解读] Neural-Symbolic Recursive Machine for Systematic Generalization
该论文提出神经符号递归机器(NSR),一种模块化框架,能够从数据中学习一种基础符号系统(GSS),以实现在序列到序列任务中的系统性泛化。通过采用新颖的演绎-溯因训练算法,将神经感知、句法解析与语义推理相结合,NSR在SCAN和PCFG上实现了100%的泛化准确率,在HINT上超越先前模型23%,展现出最先进的性能,具备强大的可迁移性并减少了对领域特定知识的依赖。
Current learning models often struggle with human-like systematic generalization, particularly in learning compositional rules from limited data and extrapolating them to novel combinations. We introduce the Neural-Symbolic Recursive Machine (NSR), whose core is a Grounded Symbol System (GSS), allowing for the emergence of combinatorial syntax and semantics directly from training data. The NSR employs a modular design that integrates neural perception, syntactic parsing, and semantic reasoning. These components are synergistically trained through a novel deduction-abduction algorithm. Our findings demonstrate that NSR's design, imbued with the inductive biases of equivariance and compositionality, grants it the expressiveness to adeptly handle diverse sequence-to-sequence tasks and achieve unparalleled systematic generalization. We evaluate NSR's efficacy across four challenging benchmarks designed to probe systematic generalization capabilities: SCAN for semantic parsing, PCFG for string manipulation, HINT for arithmetic reasoning, and a compositional machine translation task. The results affirm NSR's superiority over contemporary neural and hybrid models in terms of generalization and transferability.
研究动机与目标
- 为解决神经模型在系统性泛化方面的挑战,特别是在有限数据上外推至新组合的情况。
- 开发一个统一框架,联合学习感知、句法与语义,并具备强归纳偏置以支持组合性与等变性。
- 通过使基础符号系统(GSS)直接从训练数据中涌现,消除对手动设计的领域特定知识的依赖。
- 提升在多样化序列到序列任务(包括语义解析、字符串操作、算术推理和机器翻译)中的可迁移性与鲁棒性。
- 设计一种可微分的训练程序,用于处理非可微的符号组件,采用新颖的演绎-溯因算法。
提出的方法
- NSR采用模块化架构,集成神经感知模块、基于转移的神经依赖解析器以及基于函数程序的语义推理器。
- 基础符号系统(GSS)从数据端到端学习,将符号表示为跨任务的(输入,符号,输出)三元组。
- 采用新颖的演绎-溯因算法实现联合训练:首先通过贪婪演绎形成初始GSS;随后通过自顶向下溯因而优化GSS结构,探索邻近的GSS构型。
- 优化后的GSS作为伪监督信号,独立训练NSR的各个组件,从而克服非可微符号组件的挑战。
- 该框架嵌入了组合性与等变性的归纳偏置,支持输入的分解与重组,实现系统性泛化。
- 概率性学习框架支持端到端优化,尽管缺乏显式的GSS标注。
实验结果
研究问题
- RQ1神经符号模型能否直接从数据中学习到组合性、可解释的符号系统,而无需领域先验知识?
- RQ2具备组合性与等变性归纳偏置的模型,在序列到序列任务中对未见组合的泛化能力有多强?
- RQ3联合训练过程能否克服符号组件的不可微性,实现端到端学习?
- RQ4NSR在系统性泛化基准测试中与最先进神经模型及混合模型相比表现如何?
- RQ5NSR在真实世界、具有歧义性的任务(如组合性机器翻译)中能实现多大程度的泛化?
主要发现
- NSR在SCAN基准上实现了100%的泛化准确率,优于所有先前模型。
- 在PCFG基准上,NSR达到100%的泛化准确率,证明其对新型字符串操作规则具有完美的外推能力。
- 在HINT基准上,NSR实现了90.1%的平均测试准确率,较之前最佳模型提升23个百分点。
- NSR在组合性机器翻译任务中实现100%的泛化准确率,与NeSS性能相当,但其符号系统更具原则性且基于数据驱动。
- 该模型在多样化领域(包括语义解析、字符串操作、算术推理和真实世界翻译)中表现出强大的可迁移性,对领域特定知识的依赖极低。
- 消融研究证实,组合性与等变性的归纳偏置是NSR实现卓越泛化性能的关键因素。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。