Skip to main content
QUICK REVIEW

[论文解读] Generalization without systematicity: On the compositional skills of sequence-to-sequence recurrent networks

Brenden M. Lake, Marco Baroni|arXiv (Cornell University)|Oct 30, 2017
Natural Language Processing Techniques被引用 204
一句话总结

本文介绍了 SCAN,一个基于导航的语境化命令数据集,并系统性地评估了各种 seq2seq RNN 模型在组合泛化方面的能力,揭示在某些情形下存在强烈的零样本泛化,但在利用真正的系统性成组合性方面存在严重缺陷,并以一个简短的翻译实验作为概念验证。

ABSTRACT

Humans can understand and produce new utterances effortlessly, thanks to their compositional skills. Once a person learns the meaning of a new verb "dax," he or she can immediately understand the meaning of "dax twice" or "sing and dax." In this paper, we introduce the SCAN domain, consisting of a set of simple compositional navigation commands paired with the corresponding action sequences. We then test the zero-shot generalization capabilities of a variety of recurrent neural networks (RNNs) trained on SCAN with sequence-to-sequence methods. We find that RNNs can make successful zero-shot generalizations when the differences between training and test commands are small, so that they can apply "mix-and-match" strategies to solve the task. However, when generalization requires systematic compositional skills (as in the "dax" example above), RNNs fail spectacularly. We conclude with a proof-of-concept experiment in neural machine translation, suggesting that lack of systematicity might be partially responsible for neural networks' notorious training data thirst.

研究动机与目标

  • 将 SCAN 引入为一个受控的、面向导航的成分性指令到行动任务。
  • 在零样本、系统性泛化任务上评估广泛的 seq2seq 递归架构。
  • 识别标准模型在泛化方面成功的地方以及在展现真正的成分性方面的失败之处。
  • 探讨对神经机器翻译及更广泛的序列到序列学习在数据效率和系统性方面的启示。

提出的方法

  • 将 SCAN 视为一个带监督的 seq2seq 语义解析问题,输入 13 个单词,输出 6 个动作。
  • 系统性地测试带注意力与不带注意力的 SRN、LSTM、GRU,在 1-2 层配置和不同隐藏大小下。
  • 进行广泛的超参数搜索(180 种架构,每种 5 个种子)以确定表现最佳者。
  • 用 Adam 优化和 dropout 在 100,000 次试验上训练模型,使用教师 forcing,并采用教师 forcing 与自由回退解码两种模式。
  • 在精心设计的数据划分上评估零样本泛化,这些划分强调成分性和超出训练暴露的序列长度。
  • 包括一个概念验证的 MT 实验,以探测系统性差距是否扩展到其他 seq2seq 领域。

实验结果

研究问题

  • RQ1标准的 seq2seq RNN 能否在 SCAN 中通过混合已知部分来构造新命令(mix-and-match)进行泛化?
  • RQ2当训练样本需要泛化到更长的动作序列或原始元素与修饰词的新组合时,RNN 是否表现出真正的系统性成分性?
  • RQ3注意力机制如何影响不同架构(SRN、LSTM、GRU)在 SCAN 任务上的泛化?
  • RQ4在引入新词汇时,seq2seq 模型缺乏系统性对更广泛的 seq2seq 任务(如机器翻译)的影响程度有多大?
  • RQ5哪些策略可以促使神经模型学习抽象规则而不是表层模式识别?

主要发现

  • 当测试命令由熟悉部分组成时,RNNs 泛化良好,在某些随机子集划分中达到近乎完美的准确率。
  • 大多数模型在测试命令需要超出观察模式的系统性组合时难以泛化,随着动作序列长度的增加,准确率显著下降(长序列实验的平均最佳为 13.8%)。
  • 向左转的泛化对许多模型来说很强,但跳转的泛化很差,除非训练中暴露出相关的组合形式,凸显了系统性的不均衡。
  • 在长序列泛化中,即使有长度指引(oracle),性能也远非完美,随着更长的动作序列,准确率显著下降(例如 24 个动作时为 95.76%,48 个动作时为 22.8%)。
  • 为原语如“jump”提供更多组合示例可显著提升泛化(例如,8 个组合命令时 38.3%,16 个时 77.8%,32 个时 88.4% 的组合 jump 命令)。
  • 一个简短的 MT 实验表明,添加一个新单词(daxy)会在没有大量组合使用暴露的情况下显著降低翻译质量,暗示 seq2seq 模型在成分性泛化方面存在更广泛的局限性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。