Skip to main content
QUICK REVIEW

[論文レビュー] Data Augmentation with Atomic Templates for Spoken Language Understanding

Zijian Zhao, Su Zhu|arXiv (Cornell University)|Aug 28, 2019
Topic Modeling参考文献 20被引用数 8
ひとこと要約

本論文は、会話行動トリプルから多様で自然な発話文を最小限の人的作業で生成するための原子的テンプレートを用いたデータ拡張手法を提案する。エンコーダ-デコーダモデルを用いて、細分化された自然言語記述(アクション-スロット-値トリプルの例示)から発話文を生成することで、DSTC2およびDSTC3で顕著な性能向上を達成し、強力なベースラインを上回り、人的に作成されたテンプレートに近い性能を、はるかに低いアノテーションコストで達成する。

ABSTRACT

Spoken Language Understanding (SLU) converts user utterances into structured semantic representations. Data sparsity is one of the main obstacles of SLU due to the high cost of human annotation, especially when domain changes or a new domain comes. In this work, we propose a data augmentation method with atomic templates for SLU, which involves minimum human efforts. The atomic templates produce exemplars for fine-grained constituents of semantic representations. We propose an encoder-decoder model to generate the whole utterance from atomic exemplars. Moreover, the generator could be transferred from source domains to help a new domain which has little data. Experimental results show that our method achieves significant improvements on DSTC 2\&3 dataset which is a domain adaptation setting of SLU.

研究の動機と目的

  • スプoken言語理解(SLU)におけるデータスパarsity、特に限られたアノテーションデータしかない低リソースまたは新規ドメインにおいて、それを解決すること。
  • アクション-スロット-値トリプルを自然言語で記述する原子的テンプレートを用いることで、データ拡張における人的アノテーション負荷を軽減すること。
  • ソースドメインで事前学習した文生成モデルを、限られたシードデータでファインチューニングすることで、ターゲットドメインへの効果的なドメイン適応を可能にすること。
  • SLUモデルの訓練データにおける表現の多様性と意味的多様性を向上させること。

提案手法

  • 原子的テンプレートはフレーズレベルで作成され、個々のアクション-スロット-値トリプルの自然な言語例示を生成する。これにより、完全な文テンプレートに比べて人的作業を大幅に削減できる。
  • 系列対系列のエンコーダ-デコーダモデルを訓練し、原子的例示の集合から発話文を生成する。ここで、xは発話文、yは会話行動を表すp(x|y)をモデル化する。
  • 文生成モデルはソースドメイン(DSTC2)で事前学習され、ターゲットドメイン(DSTC3)で限られたシードデータでファインチューニングされ、効果的なドメイン適応が可能になる。
  • 会話行動を原子的例示にマッピングすることで、未知の語彙外(OOV)ラベルに対処し、未観測の意味的組み合わせへの一般化を向上させる。
  • 原子的例示を言い換えることで、多様で自然な発話文を生成するようにモデルを訓練し、表現の多様性を向上させる。
  • アブレーションスタディにより、事前学習、ファインチューニング、および文生成モデルの貢献度が評価され、性能向上におけるその重要性が示された。

実験結果

リサーチクエスチョン

  • RQ1原子的テンプレートは、SLUのデータ拡張において人的アノテーションコストを著しく削減しつつ、モデル性能を維持または向上させることができるか?
  • RQ2ターゲットドメインに限られたラベル付きデータしかない状況で、本手法はドメイン適応にどの程度有効か?
  • RQ3原子的例示から発話文を生成することで、単純な方法やテンプレートベースのベースラインと比較して、意味的多様性と表現多様性がどの程度向上するか?
  • RQ4事前学習済みの文生成モデルを含めることで、低リソース環境における生成発話の品質と一般化性能はどの程度向上するか?
  • RQ5人的に作成されたテンプレートに近い性能を達成しつつ、人的作業を著しく削減できるか?

主な発見

  • 提案手法である原子的テンプレートベースのデータ拡張により、DSTC3の評価セットでF1スコア88.6を達成し、ベースラインのゼロショットモデル(68.3)およびナーブな拡張(82.9)を著しく上回った。
  • シード短縮と組み合わせ戦略を組み合わせることで最高の性能(88.6)が得られ、多様な会話行動の生成の有効性が示された。
  • 人的に作成された文レベルテンプレート(90.4 F1)に近い性能を達成しながら、人的作業をはるかに削減したため、実用的効率性が顕著に示された。
  • アブレーションスタディにより、文生成モデルを削除すると性能が14.6ポイント低下(74.0に)し、自然な発話文を生成する上でその重要性が証明された。
  • ソースドメイン(DSTC2)での事前学習とターゲットドメイン(DSTC3)でのファインチューニングにより性能が著しく向上し、両方のステップを削除するとそれぞれ4.3点および4.1ポイントの低下が生じた。
  • ゼロ個のシードサンプルでも、ゼロショットベースラインを上回る性能を示し、未学習ドメインにおけるゼロショットまたは少数ショットSLUの能力を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。