Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Generalize Compositionally by Transferring Across Semantic Parsing Tasks

Zhu Wang, Peter J. Shaw|arXiv (Cornell University)|Nov 9, 2021
Natural Language Processing Techniques被引用数 5
ひとこと要約

本稿では、構文的合成一般化スキルを事前微調整タスクからターゲット意味解析タスクへ転送するDUELという手法を提案する。この手法は、構文的スプリット上でエンコーダーとデコーダーを別々に訓練することで、合成的構造の異なるスプリット間での一般化性能を向上させる。GeoQueryデータセットの未観測合成スプリットにおいて、最先端の性能を達成し、ゼロショットの合成一般化性能において顕著にベースラインを上回る。

ABSTRACT

Neural network models often generalize poorly to mismatched domains or distributions. In NLP, this issue arises in particular when models are expected to generalize compositionally, that is, to novel combinations of familiar words and constructions. We investigate learning representations that facilitate transfer learning from one compositional task to another: the representation and the task-specific layers of the models are strategically trained differently on a pre-finetuning task such that they generalize well on mismatched splits that require compositionality. We apply this method to semantic parsing, using three very different datasets, COGS, GeoQuery and SCAN, used alternately as the pre-finetuning and target task. Our method significantly improves compositional generalization over baselines on the test set of the target task, which is held out during fine-tuning. Ablation studies characterize the utility of the major steps in the proposed algorithm and support our hypothesis.

研究の動機と目的

  • 未知の熟語的要素の組み合わせに直面した際、ニューラルモデルが合成一般化性能に欠けるという課題に対処すること。
  • あるタスクで学習した合成一般化スキルが、類似した推論を要する、関係のない別のタスクへ転送可能かどうかを調査すること。
  • 事前微調整タスクから合成的インダクティブバイアスを抽出・転送することで、意味解析タスク間での転移学習を可能にする手法を開発すること。
  • 微調整時にそのようなスプリットを必要とせず、保持された合成的テストスプリットにおけるゼロショット一般化性能を向上させること。

提案手法

  • 訓練データとテストデータの構造的構成(例:文の長さ、文法的役割)が異なる構文的スプリットを用いた事前微調整タスクを用いてニューラルモデルを訓練する。
  • 同じ事前微調整タスクの異なるスプリット上でエンコーダーとデコーダーを別々に訓練し、エンコーダーが一般化可能で構文的な表現を学習するよう、二重学習目的関数を用いる。
  • 事前学習済みエンコーダーをターゲットタスクに適用し、ターゲットタスクの訓練データに対してはデコーダーヘッドのみを微調整することで、事前微調整段階で学習した合成的インダクティブバイアスを保持する。
  • 事前学習済みT5スタイルのエンコーダー・デコーダーモデルを用い、エンコーダーを表現学習者、デコーダーをタスク固有のヘッドとして扱う。
  • 事前微調整手順を設計し、訓練スプリットとテストスプリットの間で分布のずれを強調することで、構文的一般化行動を模倣する。
  • アブレーションスタディを用いて、二重訓練の必要性とエンコーダーの役割が、未観測の構文的スプリットへの転送を可能にするかどうかを検証する。

実験結果

リサーチクエスチョン

  • RQ1ある意味解析タスクで学習した合成一般化スキルが、構造的に異なる別の意味解析タスクへ効果的に転送可能か?
  • RQ2エンコーダーとデコーダーを異なる構文的スプリット上で訓練することで、ターゲットタスクの未観測テストスプリットにおけるゼロショット一般化性能が向上するか?
  • RQ3標準的な教師あり微調整と比較して、二重事前微調整戦略は構文的一般化性能においてどのように異なるか?
  • RQ4提案手法のどのコンponentが一般化性能の向上に最も重要であり、それぞれがどのように寄与しているか?

主な発見

  • DUELは、GeoQueryデータセットのターゲットマックスコンパoundダイバージェンススプリット(geo_cd)において、合成一般化性能を顕著に向上させ、以前の最先端ニューラルモデルを上回った。
  • GeoQueryの長さ一般化スプリット(geo_len)において、DUELは強力なベースラインに対して顕著な改善を達成し、より長い文へのロバストなゼロショット一般化を示した。
  • アブレーションスタディにより、構文的スプリット上で二重訓練が転送に不可欠であり、エンコーダーが学習した表現が一般化を可能にする鍵的役割を果たしていることが確認された。
  • 事前微調整タスクとターゲットタスクの構造が大きく異なる場合(例:合成データセット(COGS, SCAN)から実世界データセット(GeoQuery)への転送)でも、本手法は効果的に一般化できる。
  • 事前微調整タスクとターゲットタスクが互いに非常に似ている場合、転送性能が制限されることが示され、本手法はタスク間の構造的多様性に最も恩恵を受けることがわかった。
  • 本手法はCOGS、GeoQuery、SCANの3つの異なる意味解析データセットにおいて有効であり、転送可能なインダクティブバイアスの広範な適用可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。