Skip to main content
QUICK REVIEW

[論文レビュー] Variational Attention for Sequence-to-Sequence Models

Hareesh Bahuleyan, Lili Mou|arXiv (Cornell University)|Dec 21, 2017
Topic Modeling参考文献 27被引用数 20
ひとこと要約

本稿では、変分エンコーダ・デコーダ(VED)モデルにおける変分潜在空間の無効化を防ぐために、注意ベクトルをガウス分布に従う確率的変数としてモデル化する変分注意機構を提案する。学習可能な事前分布を用いた確率的注意を導入することで、出力品質を損なうことなく生成の多様性を向上させることができ、質問生成および対話システムの実験でその有効性が示された。

ABSTRACT

The variational encoder-decoder (VED) encodes source information as a set of random variables using a neural network, which in turn is decoded into target data using another neural network. In natural language processing, sequence-to-sequence (Seq2Seq) models typically serve as encoder-decoder networks. When combined with a traditional (deterministic) attention mechanism, the variational latent space may be bypassed by the attention model, and thus becomes ineffective. In this paper, we propose a variational attention mechanism for VED, where the attention vector is also modeled as Gaussian distributed random variables. Results on two experiments show that, without loss of quality, our proposed method alleviates the bypassing phenomenon as it increases the diversity of generated sentences.

研究の動機と目的

  • 変分エンコーダ・デコーダ(VED)モデルにおける「無視現象(bypassing)」を解消すること。これは、決定的注意が変分潜在空間の有効性を低下させるためである。
  • 変分エンコーダ・デコーダに基づくテキスト生成タスクにおける生成シーケンスの多様性を向上させること。これには、注意機構に確率的モデリングを統合する。
  • 生成品質を損なわず、一般化可能なフレームワークを構築すること。

提案手法

  • 標準のSeq2Seqモデルにおける決定的注意ベクトルを置き換え、注意ベクトルをガウス分布に従う確率的変数としてモデル化する。
  • 注意ベクトルに適した2つの妥当な事前分布を導入する:標準正規分布と、エンコーダの隠れ状態の平均を平均とする事前分布。
  • 再構成損失と事後分布と事前分布のKLダイバージェンスを最適化するため、変分下界の目的関数を用いてモデルをエンドツーエンドで学習する。
  • 訓練中はモンテカルロサンプルを用いて期待値を近似し、確率的注意ベクトルを介してバックプロパゲーションを可能にする。
  • 質問生成や対話応答生成などのシーケンス・ツー・シーケンスタスクにこのフレームワークを適用する。

実験結果

リサーチクエスチョン

  • RQ1VEDモデルにおける決定的注意は、変分潜在空間の無視を引き起こし、生成の多様性を低下させるか?
  • RQ2注意ベクトルを確率的事前分布に従う確率的変数としてモデル化することで、生成シーケンスの多様性が向上するか?
  • RQ3生成の多様性と品質の両面において、提案された変分注意機構は決定的注意と比べてどのように優れているか?

主な発見

  • 提案された変分注意機構は、質問生成および対話システムの両方において、Dist-1およびDist-2で測定した文の多様性を、決定的注意よりも顕著に向上させた。
  • 質問生成タスクでは、VED+VAttn-\bar{h}がサンプリング条件下でDist-1: 0.324、Dist-2: 0.467を達成し、VED+DAttn(Dist-1: 0.311、Dist-2: 0.450)を上回った。
  • コロンビア映画対話コーパスでは、VED+VAttn-\bar{h}がサンプリング条件下でBLEU-2スコア1.79を達成し、VED+DAttn(1.68)を上回った。これは生成品質の向上を示している。
  • モデルは高い出力品質を維持しており、BLEU-2スコアが決定的モデルとほぼ同等に保たれており、多様性が向上しても品質に劣化は見られなかった。
  • アブレーションスタディの結果、事前分布の選択(ゼロ平均または隠れ状態の平均)が性能に影響することが確認され、後者のほうが優れた結果を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。