[论文解读] Compositional Generalization for Primitive Substitutions
本文提出了一种新颖的神经网络架构,通过为输入句子使用两种不同的表示方式来增强组合泛化能力:一种用于生成注意力图,另一种用于将关注的词映射到输出符号。通过在两种表示中降低熵,该模型在组合泛化任务上实现了最先进性能,在SCAN Jump任务上的准确率从14.0%提升至98.8%,在TurnLeft任务上的准确率从92.0%提升至99.7%,并且在少样本学习基准上甚至超越了人类表现。
Compositional generalization is a basic mechanism in human language learning, but current neural networks lack such ability. In this paper, we conduct fundamental research for encoding compositionality in neural networks. Conventional methods use a single representation for the input sentence, making it hard to apply prior knowledge of compositionality. In contrast, our approach leverages such knowledge with two representations, one generating attention maps, and the other mapping attended input words to output symbols. We reduce the entropy in each representation to improve generalization. Our experiments demonstrate significant improvements over the conventional methods in five NLP tasks including instruction learning and machine translation. In the SCAN domain, it boosts accuracies from 14.0% to 98.8% in Jump task, and from 92.0% to 99.7% in TurnLeft task. It also beats human performance on a few-shot learning task. We hope the proposed approach can help ease future research towards human-level compositional language learning.
研究动机与目标
- 为解决神经网络在组合泛化方面的不足,该不足限制了其对已知语言成分新组合的泛化能力。
- 克服单表示模型在序列到序列任务中无法有效利用组合性先验知识的局限。
- 通过显式编码结构和功能组合性,提升指令学习和机器翻译中的零样本和少样本泛化能力。
- 证明在双表示上施加熵正则化可实现对未见组合结构的稳健泛化。
提出的方法
- 该模型使用两种并行表示:一种是‘功能表示’,用于生成输入词的注意力图;另一种是‘原始表示’,用于将关注的词映射到输出符号。
- 注意力图由功能表示生成,该表示关注输入句子中的相关词,以指导动作预测。
- 原始表示编码已知的原始单元(例如,'jump'、'turn left'),并基于关注的输入词来解码输出动作。
- 在训练过程中,通过降低两种表示的熵,以鼓励解耦且低熵的表示,从而支持更好的泛化。
- 该方法在序列到序列预测任务上端到端训练,使用交叉熵损失,且对组合性无显式监督。
- 该方法在SCAN、SCAN-ADJ以及指令学习和机器翻译基准上进行评估,以衡量组合与句法泛化能力。
实验结果
研究问题
- RQ1具有双表示的神经网络架构是否能超越单表示模型,在组合泛化方面实现更优表现?
- RQ2在功能表示和原始表示上施加熵正则化,是否能增强序列到序列任务中的零样本和少样本泛化能力?
- RQ3所提出的方法能否泛化到未见的组合结构,例如'jump twice'或'turn left after jump'?
- RQ4在涉及组合泛化的少样本学习场景中,该模型是否能超越人类表现?
- RQ5该方法在SCAN中的非组合任务(如Simple和Length任务)上的性能保持程度如何?
主要发现
- 所提方法在SCAN Jump任务上达到98.8%的准确率,相比之前最先进方法的14.0%有显著提升。
- 在TurnLeft任务上,模型准确率达到99.7%,高于以往工作的92.0%,表明其具备强大的组合泛化能力。
- 在SCAN任务的一个少样本学习变体中,该模型表现超越人类,这是首次有神经网络在该设置下超越人类。
- 消融实验表明,对两种表示同时施加熵正则化至关重要——若移除正则化,性能将显著下降。
- 该方法在非组合任务(如Simple和Length任务)上仍保持优异性能,准确率分别为99.9%和20.3%,表明其对标准序列建模无负面影响。
- 该方法在指令学习和机器翻译任务上也表现出有效泛化,显示出超越合成基准的广泛适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。