Skip to main content
QUICK REVIEW

[論文レビュー] Compositional Generalization for Primitive Substitutions

Yuanpeng Li, Liang Zhao|arXiv (Cornell University)|Oct 7, 2019
Natural Language Processing Techniques参考文献 36被引用数 10
ひとこと要約

本稿では、入力文に対して2つの異なる表現を用いることで構文的一般化を向上させる、新たなニューラルネットワークアーキテクチャを提案する。1つは注意マップの生成に用いられ、もう1つは注目された語を出力記号にマッピングする。両表現におけるエントロピーの低減により、構文的一般化タスクで最先端の性能を達成し、SCAN Jumpタスクでは14.0%から98.8%へ、TurnLeftタスクでは92.0%から99.7%へと精度が向上した。また、少サンプル学習ベンチマークでは人間を上回る性能を示した。

ABSTRACT

Compositional generalization is a basic mechanism in human language learning, but current neural networks lack such ability. In this paper, we conduct fundamental research for encoding compositionality in neural networks. Conventional methods use a single representation for the input sentence, making it hard to apply prior knowledge of compositionality. In contrast, our approach leverages such knowledge with two representations, one generating attention maps, and the other mapping attended input words to output symbols. We reduce the entropy in each representation to improve generalization. Our experiments demonstrate significant improvements over the conventional methods in five NLP tasks including instruction learning and machine translation. In the SCAN domain, it boosts accuracies from 14.0% to 98.8% in Jump task, and from 92.0% to 99.7% in TurnLeft task. It also beats human performance on a few-shot learning task. We hope the proposed approach can help ease future research towards human-level compositional language learning.

研究の動機と目的

  • ニューラルネットワークにおける構文的一般化の欠如が、既知の言語的要素の新たな組み合わせへの一般化能力を制限することへの対処。
  • 系列対系列タスクにおける構文性の事前知識を活用できない単一表現モデルの限界を克服すること。
  • 指示学習および機械翻訳におけるゼロショットおよび少サンプル一般化を向上させることで、構造的および機能的構文性を明示的に符号化すること。
  • 二重表現におけるエントロピー正則化が、未観測の構文的構造への頑健な一般化を可能にすることの実証。

提案手法

  • モデルは2つの並列表現を用いる:入力語の注意マップを生成する「機能表現」と、注目された語を出力記号にマッピングする「プリミティブ表現」。
  • 注意マップは機能表現によって生成され、関連する語に注目することで行動予測をガイドする。
  • プリミティブ表現は既知のプリミティブ(例:'jump'、'turn left')を符号化し、注目された入力語に基づいて出力行動を復号するために用いられる。
  • トレーニング中に両表現におけるエントロピーを低減することで、分離され、低エントロピーな表現を促進し、より良い一般化を実現する。
  • 構文性に関する明示的な教師信号なしに、シーケンス対シーケンス予測タスクでクロスエントロピー損失を用いてエンドツーエンドで学習される。
  • 構文的および文法的一般化を評価するために、SCAN、SCAN-ADJ、および指示学習および機械翻訳ベンチマークでアプローチが評価される。

実験結果

リサーチクエスチョン

  • RQ1二重表現を持つニューラルネットワークアーキテクチャは、単一表現モデルに比べて構文的一般化を向上させることができるか?
  • RQ2機能的およびプリミティブ表現におけるエントロピー正則化は、系列対系列タスクにおけるゼロショットおよび少サンプル一般化を向上させるか?
  • RQ3本手法は、'jump twice' や 'turn left after jump' のような未観測の構文的構造にも一般化できるか?
  • RQ4本モデルは、構文的一般化を含む少サンプル学習シナリオにおいて、人間の性能を上回ることができるか?
  • RQ5本手法は、SCANにおける非構文的タスク(SimpleおよびLengthタスク)において、どの程度の性能を維持するか?

主な発見

  • 提案手法は、SCAN Jumpタスクで98.8%の精度を達成し、前回の最先端手法の14.0%から顕著な向上を示した。
  • TurnLeftタスクでは99.7%の精度を達成し、前回の研究より92.0%から向上した。これは強力な構文的一般化を示している。
  • 少サンプル学習バージョンのSCANタスクにおいて、人間の性能を上回った。これは、このような設定でニューラルネットワークが人間を上回った初めての事例である。
  • アブレーションスタディでは、両表現におけるエントロピー正則化が不可欠であることが判明。これを除去すると、性能が著しく低下した。
  • 非構文的タスク(SimpleおよびLengthタスク)においても、それぞれ99.9%および20.3%の高い精度を維持しており、標準的な系列モデリングに悪影響を及えないことが示された。
  • 本手法は、合成ベンチマークにとどまらず、指示学習および機械翻訳タスクに対しても効果的に一般化でき、広範な適用可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。