Skip to main content
QUICK REVIEW

[論文レビュー] Cross-domain Semantic Parsing via Paraphrasing

Yu Su, Xifeng Yan|arXiv (Cornell University)|Apr 20, 2017
Topic Modeling参考文献 46被引用数 12
ひとこと要約

本稿では、論理形式を標準的な自然言語表現に変換することで、意味解析を再定式化するクロスドメイン意味解析フレームワークを提案する。注意メカニズムを備えたシーケンス・ツー・シーケンスの並び替えモデルと標準化された事前学習済み単語埋め込みを用いることで、特にドメイン内訓練データが限られる状況でも顕著な精度向上を達成し、オーバンナイトデータセットにおいてベースライン埋め込みよりも最大で10%の絶対的改善を示した。

ABSTRACT

Existing studies on semantic parsing mainly focus on the in-domain setting. We formulate cross-domain semantic parsing as a domain adaptation problem: train a semantic parser on some source domains and then adapt it to the target domain. Due to the diversity of logical forms in different domains, this problem presents unique and intriguing challenges. By converting logical forms into canonical utterances in natural language, we reduce semantic parsing to paraphrasing, and develop an attentive sequence-to-sequence paraphrase model that is general and flexible to adapt to different domains. We discover two problems, small micro variance and large macro variance, of pre-trained word embeddings that hinder their direct use in neural networks, and propose standardization techniques as a remedy. On the popular Overnight dataset, which contains eight domains, we show that both cross-domain training and standardized pre-trained word embeddings can bring significant improvement.

研究の動機と目的

  • ドメイン内訓練データが限られる低リソースのターゲットドメインにおいて、効果的な意味解析器を訓練するという課題に対処すること。
  • 論理形式を標準的な自然言語表現に変換することで、クロスドメイン意味解析を並び替え問題に還元すること。
  • 事前学習済み単語埋め込みにおける問題を特定・解決することで、ニューラルネットワークのドメイン適応性能を向上させること。
  • 異なる論理形式と語彙を有する複数のドメインにわたる並び替え知識の転送を可能にする汎用的で柔軟なフレームワークの開発

提案手法

  • 意味解析を並び替えタスクに変換するために、論理形式を標準的な自然言語表現に変換する。
  • ソースドメインからターゲットドメインへの並び替えマッピングを学習するため、注意メカニズムを備えたシーケンス・ツー・シーケンスモデルを訓練する。
  • 2つの問題に対処することで、事前学習済み単語埋め込みを標準化する:微小なマイクロ分散(最適化を損なう)と大きなマクロ分散(一般化性能を損なう)。
  • 各例ごとの標準化を事前学習済み単語埋め込み(例:word2vec)に適用し、低リソース環境下でのモデル安定性と性能を向上させる。
  • 外部言語リソースを複数のドメインに一貫して統合可能な統一フレームワークを採用する。
  • ドメインが8つあるオーバンナイトデータセットを用い、ドメイン内データ量の違いを考慮してモデルの性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1標準的な表現を中間表現として用いることで、クロスドメイン意味解析を並び替えタスクとして効果的に定式化できるか?
  • RQ2事前学習済み単語埋め込みにおける問題点(特に微小なマイクロ分散と大きなマクロ分散)が、クロスドメイン環境下でのニューラルネットワーク学習にどのように影響するか?
  • RQ3事前学習済み単語埋め込みの標準化が、低リソースのターゲットドメインにおける意味解析精度をどの程度向上させるか?
  • RQ4ドメイン内訓練データの豊富さに応じて、クロスドメイン学習の利点はどのように変化するか?

主な発見

  • 提案された並び替えベースのフレームワークは、ドメイン内訓練データが限られる状況においても、クロスドメイン意味解析性能を顕著に向上させる。
  • 標準化された事前学習済み単語埋め込みは、word2vecや従来の正規化手法を直接使用した場合と比較して、約10%の絶対的精度向上をもたらす。
  • ドメイン内データ量とクロスドメイン学習による性能向上の間には負の相関(r = -0.770)が存在し、データが少ない状況での利点が顕著であることが示された。
  • ダウンサンプリング実験の結果、ドメイン内データが限られる状況でクロスドメイン学習が最大の恩恵をもたらし、データ比が高くなると、完全なデータ量に近い性能にまで到達することが確認された。
  • オーバンナイトデータセットの全8ドメインにおいて一貫した改善が得られ、多様なドメインにわたる強固さとスケーラビリティを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。