Skip to main content
QUICK REVIEW

[論文レビュー] Improving Compositional Generalization with Latent Structure and Data Augmentation

Linlu Qiu, Peter Shaw|arXiv (Cornell University)|Dec 14, 2021
Natural Language Processing Techniques被引用数 13
ひとこと要約

本稿では、合成構造学習者(CSL)と呼ばれる生成モデルを用いたデータ拡張法を提案する。CSLは準同期的文脈自由文法(QCFG)をバックボーンとし、学習データから潜在的な合成的構造を誘導する。この構造を用いて合成された訓練例を生成することで、T5の微調整を強化し、診断的および実世界の意味解析タスクにおいて、T5-CSLアンサンブルでさえも上回る最先端の性能を達成した。

ABSTRACT

Generic unstructured neural networks have been shown to struggle on out-of-distribution compositional generalization. Compositional data augmentation via example recombination has transferred some prior knowledge about compositionality to such black-box neural models for several semantic parsing tasks, but this often required task-specific engineering or provided limited gains. We present a more powerful data recombination method using a model called Compositional Structure Learner (CSL). CSL is a generative model with a quasi-synchronous context-free grammar backbone, which we induce from the training data. We sample recombined examples from CSL and add them to the fine-tuning data of a pre-trained sequence-to-sequence model (T5). This procedure effectively transfers most of CSL's compositional bias to T5 for diagnostic tasks, and results in a model even stronger than a T5-CSL ensemble on two real world compositional generalization tasks. This results in new state-of-the-art performance for these challenging semantic parsing tasks requiring generalization to both natural language variation and novel compositions of elements.

研究の動機と目的

  • 既知の要素の分布外の組み合わせに対してしばしば失敗する神経的シーケンス・ツー・シーケンスモデルにおける合成的汎化の課題に対処すること。
  • タスク固有のアーキテクチャ設計や膨大な人手によるアノテーションに依存せずに、未知の組み合わせへの汎化を向上させること。
  • 構造的生成モデルから得られる合成的バイアスを、T5のような柔軟で事前学習済みのシーケンス・ツー・シーケンスモデルに転送するデータ拡張法を開発すること。
  • 実世界の意味解析ベンチマークにおいて、専門的なモデルのアンサンブルを含む既存手法よりも優れた性能を達成すること。

提案手法

  • CSLは、学習データから自動的に誘導される準同期的文脈自由文法(QCFG)をバックボーンとする生成モデルとして学習される。
  • モデルは入力-出力ペアの確率的分布を学習し、訓練例を再帰的に再結合することで新たな合成的形態を生成可能となる。
  • CSLからサンプリングされた合成訓練例を元のデータと組み合わせ、事前学習済みのT5シーケンス・ツー・シーケンスモデルを微調整する。
  • この手法はCSLの合成的バイアスを活用しつつ、T5が自然言語の変異や複雑な表面形式を処理する能力を維持する。
  • CSLは文法規則の微分可能探索アルゴリズムを用いてエンド・ツー・エンドで学習され、タスク固有の制約なしに高カバレッジの文法誘導を可能にする。
  • 従来の方法が固定または決定的再結合に限られていたのに対し、本手法は再帰的再結合と確率的サンプリングを可能にすることで、先行研究を一般化している。

実験結果

リサーチクエスチョン

  • RQ1自己教師的でデータ駆動型の合成的構造誘導手法は、神経的シーケンス・ツー・シーケンスモデルにおける汎化性能を向上させ得るか?
  • RQ2潜在的なQCFG構造を持つ生成モデルは、事前学習済みシーケンスモデルに合成的バイアスを転送する際に、判別モデルと比べてどのように異なるか?
  • RQ3合成的再結合によって生成された合成データは、実世界の合成的汎化タスクにおける性能をどの程度向上させ得るか?
  • RQ4本手法は、GECA や固定文法を用いた例の再結合といった既存のデータ拡張技術を上回るか?
  • RQ5CSL学習時に無ラベルデータを含めることで、下流の汎化性能にどのような影響を与えるか?

主な発見

  • CSLで拡張されたデータで微調整したT5モデルは、CFQおよびCOGSの診断的タスクで、ベースラインT5およびT5-CSLアンサンブルを上回る最先端の性能を達成した。
  • 実世界のSMCalFlow-CSデータセットでは、T5+CSL-AugはベースラインT5モデルに比べてクロスドメイン汎化性能で7.8%の絶対的向上を達成した。
  • GeoQueryでは、3回の実行で平均正答率93.3%(標準偏差0.2)を達成し、高い安定性と優れた性能を示した。
  • 無ラベルデータの取り込みは、合成例を1,000個だけサンプリングする場合に性能向上をもたらしたが、100,000個に達するとほとんど利益が得られず、飽和またはカバレッジの限界を示唆した。
  • 誤差解析の結果、単一ドメインの約60%、クロスドメインの約35%の誤りが、一貫性のないまたは曖昧なアノテーションに起因しており、アノテーション品質が主なボトルネックであることが示された。
  • クロスドメインの例において、特に多段階組織図のクエリ処理など、深くネストされたプログラム構造に対しては、モデルの性能が著しく低下しており、複雑な合成的構造の処理における限界が明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。