Skip to main content
QUICK REVIEW

[論文レビュー] Diverse Demonstrations Improve In-context Compositional Generalization

Itay Levy, Ben Bogin|arXiv (Cornell University)|Dec 13, 2022
Natural Language Processing Techniques被引用数 4
ひとこと要約

本論文では、既知の要素の未知の組み合わせを処理しなければならない意味解析における構成的一般化を向上させるために、多様なデモをインコンテキスト学習に活用することを提案する。モデルが処理すべきプログラム構造を網羅的にカバーするデモを選択する、カバレッジに基づく戦略であるCover-LSを用いることで、純粋なインコンテキスト学習および微調整を組み合わせた設定の両方で、構成的一般化ベンチマークにおいて最大23ポイントの性能向上が達成された。

ABSTRACT

In-context learning has shown great success in i.i.d semantic parsing splits, where the training and test sets are drawn from the same distribution. In this setup, models are typically prompted with demonstrations that are similar to the input utterance. However, in the setup of compositional generalization, where models are tested on outputs with structures that are absent from the training set, selecting similar demonstrations is insufficient, as often no example will be similar enough to the input. In this work, we propose a method to select diverse demonstrations that aims to collectively cover all of the structures required in the output program, in order to encourage the model to generalize to new structures from these demonstrations. We empirically show that combining diverse demonstrations with in-context learning substantially improves performance across three compositional generalization semantic parsing datasets in the pure in-context learning setup and when combined with finetuning.

研究の動機と目的

  • インコンテキスト学習が、テスト入力と類似する単一のトレーニング例が存在しない構成的一般化の設定で失敗するのを是正すること。
  • デモセットの多様性を高めることでモデルの一般化性能を向上させ、必要なすべてのプログラム構造がカバーされることを保証すること。
  • 入力との類似性だけでなく、ターゲットプログラムを網羅的にカバーする構造的補完性を考慮してデモを選択する手法を開発すること。
  • 純粋なインコンテキスト学習と微調整の両方の設定において、多様なデモの有効性を評価すること。

提案手法

  • ターゲット出力内の局所的プログラム構造を同定し、それらを総合的にカバーするデモを選択する、カバレッジに基づくリtrieval手法であるCover-LSを提案する。
  • モデルの予測を用いてターゲットプログラム内の潜在的な部分構造を同定し、それらをカバーする例を検索することで、構造的多様性を向上させる。
  • 予測された局所的構造のカバレッジを最大化しつつ多様性を保つように、候補デモのビームサーチを実行する。
  • 入力の類似性とは無関係に、異なるプログラム構造を持つデモを優先するリtrievalアプローチを採用する。
  • モデルがデモを入力として使用できるように、微調整を組み合わせる。ノイズを含むデモを用いることで、過剰に依存するのを防ぐ。
  • ニューラルおよび非ニューラルのリtrieverを併用してデモを選択し、開発セットでの性能を評価して最適なリtrieval戦略を選定する。

実験結果

リサーチクエスチョン

  • RQ1必要なプログラム構造を網羅的にカバーする多様なデモを選択することで、構成的一般化タスクにおけるインコンテキスト学習の性能が向上するか?
  • RQ2少数の例で行う意味解析において、カバレッジに基づくデモ選択は類似性に基づく選択を上回るか?
  • RQ3微調整と組み合わせた場合と純粋なインコンテキスト学習とで、多様なデモの使用が性能に与える影響は何か?
  • RQ4多様なデモを用いることで、効果的な一般化に必要な例の数を減らせるか?
  • RQ5デモの構造的多様性が、分布外の難易度の高い例に対する性能向上に寄与するか?

主な発見

  • Cover-LS手法は、類似性ベースのベースラインと比較して、SMCalFlow-CSデータセットにおいて最大23.2ポイントの性能向上を達成した。
  • H-CLUTRRおよびGeoQuery-CSデータセットでは、純粋なインコンテキスト学習を含むすべての設定で、多様なデモが一貫した改善をもたらした。
  • 効果的な一般化に必要なデモの数を削減した。多様性のおかげで、より効率的な少数の例での学習が可能になった。
  • 特に難易度の高い例において性能向上が顕著に現れ、未学習のプログラム構造への一般化が向上した。
  • 微調整を伴う・なしの両方の設定において、複数の構成的意味解析ベンチマークで最先端の結果を達成した。
  • カバレッジに基づく多様性(Cover-LS)は、単に例の相違度に基づく多様性を上回った。これは、構造的関連性の重要性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。