Skip to main content
QUICK REVIEW

[論文レビュー] Generalization without systematicity: On the compositional skills of sequence-to-sequence recurrent networks

Brenden M. Lake, Marco Baroni|arXiv (Cornell University)|Oct 30, 2017
Natural Language Processing Techniques被引用数 204
ひとこと要約

本論文は SCAN を導入し、 grounded navigation command dataset を用いた制御された構成的な命令-行動タスクを提案し、さまざまな seq2seq RNN モデルを組み合わせ的に一般化する能力について体系的に評価しています。いくつかのケースでゼロショット一般化が強い一方、真の体系的組成性を利用することには重大な失敗があることを明らかにし、概念実証としての短い翻訳実験を報告します。

ABSTRACT

Humans can understand and produce new utterances effortlessly, thanks to their compositional skills. Once a person learns the meaning of a new verb "dax," he or she can immediately understand the meaning of "dax twice" or "sing and dax." In this paper, we introduce the SCAN domain, consisting of a set of simple compositional navigation commands paired with the corresponding action sequences. We then test the zero-shot generalization capabilities of a variety of recurrent neural networks (RNNs) trained on SCAN with sequence-to-sequence methods. We find that RNNs can make successful zero-shot generalizations when the differences between training and test commands are small, so that they can apply "mix-and-match" strategies to solve the task. However, when generalization requires systematic compositional skills (as in the "dax" example above), RNNs fail spectacularly. We conclude with a proof-of-concept experiment in neural machine translation, suggesting that lack of systematicity might be partially responsible for neural networks' notorious training data thirst.

研究の動機と目的

  • SCAN を、ナビゲーションに基づく制御された構成的な命令-行動タスクとして導入する。
  • ゼロショットの体系的一般化タスクに対して、幅広い seq2seq リカレントアーキテクチャを評価する。
  • 標準的なモデルが一般化で成功する部分と、真の構成性を示せない部分を特定する。
  • データ効率性と体系性に関して、ニューラル機械翻訳およびより広いシーケンス対シーケンス学習への示唆を探る。

提案手法

  • SCAN を、13 の入力語と6 の出力動作を持つ監視付き seq2seq セマンティックパーシング問題として扱う。
  • SRN、LSTM、GRU を、アテンションの有無を問わず、1〜2 層構成とさまざまな隠れ層のサイズで系統的にテストする。
  • トップのパフォーマーを特定するために、広範なハイパーパラメータ探索(180 アーキテクチャ、各5 シード)を実施する。
  • Adam 最適化とドロップアウトを用い、100,000 回の試行で教師付きフォーシングを用いた訓練を行い、教師付きフォーシングとフリーランニングデコーディングの両方を適用する。
  • 訓練で経験した範囲を超える構成性とシーケンス長を重視した慎重に設計された分割でゼロショット一般化を評価する。
  • 他の seq2seq 領域にも体系性の欠陥が及ぶかを検証するための概念実証 MT 実験を含める。

実験結果

リサーチクエスチョン

  • RQ1SCAN で既知の部品を混ぜ合わせて新しい命令を作る(ミックスアンドマッチ)ことに、標準的な seq2seq RNN が一般化できるか?
  • RQ2長いアクション列やプリミティブと修飾子の新しい組み合わせへ一般化を要する学習例の場合、RNN は真の体系的構成性を示すか?
  • RQ3SCAN 課題における異なるアーキテクチャ(SRN、LSTM、GRU)で、アテンションは一般化にどのように影響するか?
  • RQ4新しい語彙を導入したとき、seq2seq モデルの構成性の欠如は、機械翻訳などのより広い seq2seq タスクにどの程度影響するか?
  • RQ5ニューラルモデルが表面的なパターン認識ではなく抽象的な規則を学ぶよう促す戦略は何か?

主な発見

  • RNNs は、テスト命令が既知の部品から構成される場合に高い一般化性能を示し、いくつかのランダムサブセット分割でほぼ完璧な精度を達成する。
  • 多くのモデルは、訓練で観測したパターンを超える体系的構成が要求されるテスト命令で一般化に失敗し、アクション列の長さが増えると大幅に低下する(長いシーケンス実験で平均 13.8% が最高)。
  • Turn-left の一般化は多くのモデルで強いが、related composed forms を訓練で露出させない限り jump の一般化は乏しく、体系性が不均一であることを強調。
  • 長いシーケンス一般化では、 oracle length guidance を用いても性能はほぼ完璧から遠く、アクション長が長くなると精度が著しく低下する(例: 24 アクションで 95.76%、48 アクションで 22.8%)。
  • "jump" のような原語を追加で構成した例を提供すると一般化が大幅に改善される(例: 8 回構成で 38.3%、16 回で 77.8%、32 回で 88.4%)。
  • 短い MT 実験では、新しい語を追加すると翻訳が劇的に劣化することが示され、構成的一般化の広い限界を示唆している( composed uses の広範な曝露が必要)۔

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。