Skip to main content
QUICK REVIEW

[論文レビュー] Disentangled Sequence to Sequence Learning for Compositional Generalization

Hao Zheng, Mirella Lapata|arXiv (Cornell University)|Oct 9, 2021
Natural Language Processing Techniques被引用数 9
ひとこと要約

本稿では、Dangleを提案する。これは、各デコードステップにおいて現在のターゲットコンテキストに応じて、入力の再エンコーディングを動的に適応させる、シーケンス・トゥ・シーケンスモデルの拡張手法である。このメカニズムにより表現のエンタングルメントが軽減され、意味解析および機械翻訳タスクにおける未観測の構成の一般化が向上し、COGS、CFQ、CoGnitionベンチマークで強力なベースラインを上回る性能を発揮する。

ABSTRACT

There is mounting evidence that existing neural network models, in particular the very popular sequence-to-sequence architecture, struggle to systematically generalize to unseen compositions of seen components. We demonstrate that one of the reasons hindering compositional generalization relates to representations being entangled. We propose an extension to sequence-to-sequence models which encourages disentanglement by adaptively re-encoding (at each time step) the source input. Specifically, we condition the source representations on the newly decoded target context which makes it easier for the encoder to exploit specialized information for each prediction rather than capturing it all in a single forward pass. Experimental results on semantic parsing and machine translation empirically show that our proposal delivers more disentangled representations and better generalization.

研究の動機と目的

  • 標準的なシーケンス・トゥ・シーケンスモデルが、既知の要素の未観測な組み合わせに対して一般化に失敗することへの対処。
  • 隠れ状態において意味的要因(意味や関係)が相互に依存する表現のエンタングルメントが、一般化性能の低下の主な要因であると特定すること。
  • 現在のターゲットコンテキストに基づいてデコーダーの状態を動的に統合することで、エンコーダーの入力表現を再エンコードする方法の開発により、分離された表現を実現すること。
  • このアプローチが、タスク固有の修正や分離の明示的教師信号なしに、ゼロショット一般化を向上させることの証明。
  • COGS、CFQ、CoGnitionを含む複数のベンチマークでこの手法を検証し、その堅牢性と一般化可能性を示すこと。

提案手法

  • デコーダーの現在の隠れ状態に応じて、各デコードステップで入力を再エンコーディングする適応的再エンコーディング機構を導入する。
  • 新たに生成されたターゲットコンテキストに応じて、入力表現を条件づけることで、エンコーダーが現在の予測に必要な意味的要因に集中できるようにする。
  • 標準的なシーケンス・トゥ・シーケンスアーキテクチャを、各ステップでデコーダー状態の情報をエンコーダーの入力表現に統合することで変更する。
  • 動的コンテキスト条件付けを活用することで、関係やエンティティなどの異なるコンポーネントに対して専用の表現を維持するコンテキストに適応したエンコーダーを構築する。
  • 分離のための追加正則化や教師信号なしに、標準的なシーケンス・トゥ・シーケンスの目的関数に従って、モデルをエンドツーエンドで学習する。
  • 意味解析および機械翻訳の両タスクにこの手法を適用し、ゼロショットおよび分布外一般化において一貫した向上を示す。

実験結果

リサーチクエスチョン

  • RQ1標準的なシーケンス・トゥ・シーケンスモデルにおける表現のエンタングルメントは、どの程度構成的一般化の障壁となっているか?
  • RQ2現在のターゲットコンテキストに応じた入力の適応的再エンコーディングは、より分離された表現を実現できるか?
  • RQ3この動的再エンコーディング機構は、意味解析および機械翻訳における未観測の構成的構造の一般化を改善するか?
  • RQ4この手法は、ゼロショットおよび分布外設定において、強力なベースラインや特化した技術と比較してどのように優れているか?
  • RQ5明示的な分離の教師信号なしに、モデルは馴染みのある構文的および意味的コンポーネントの新しい組み合わせに一般化できるか?

主な発見

  • 提案されたDangleモデルは、COGSベンチマークで最先端の性能を達成し、語彙的および構造的一般化タスクの両方で強力なベースラインを上回った。
  • CFQベンチマークでは、Dangleはゼロショット一般化において顕著な向上を示し、特に複雑でネストされた構成的クエリにおいて顕著であった。
  • 機械翻訳タスクでは、Dangleは「floorの上の小さな医者を追い越した」のようなレアな複合語句を、全5つのテスト文脈で正しく翻訳したが、ベースラインは一貫して失敗した。
  • アテンションと表現分析の結果、Dangleは関係やエンティティの分離性が向上しており、表現のエンタングルメントが軽減されたことが裏付けられた。
  • 適応的再エンコーディング機構により、より堅牢でコンテキスト特化型の入力表現が得られ、アーキテクチャ的・データセット特化的修正なしに一般化性能が向上した。
  • この手法は異なるタスクやドメインにわたり一般化可能であり、意味解析、機械翻訳、論理的推論ベンチマークにおいて、構成的一般化の分野で一貫した向上を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。