Skip to main content
QUICK REVIEW

[論文レビュー] Learning Sparse Prototypes for Text Generation

Junxian He, Taylor Berg-Kirkpatrick|arXiv (Cornell University)|Jun 29, 2020
Topic Modeling参考文献 48被引用数 10
ひとこと要約

本稿では、スパース性を誘導するディリクレ事前分布とアンモタイズド変分推論を用いて、コン pact で高品質なプロトタイプ集合を自動で学習するスパースプロトタイプベースのテキスト生成モデルを提案する。本手法は、従来のプロトタイプモデルと比較して、メモリ使用量と速度で最大1000倍の改善を達成するとともに、言語モデル性能を最大14パープレキシティポイント向上させ、学習されたプロトタイプを用いた制御可能で意味的に明確な編集を可能にする。

ABSTRACT

Prototype-driven text generation uses non-parametric models that first choose from a library of sentence "prototypes" and then modify the prototype to generate the output text. While effective, these methods are inefficient at test time as a result of needing to store and index the entire training corpus. Further, existing methods often require heuristics to identify which prototypes to reference at training time. In this paper, we propose a novel generative model that automatically learns a sparse prototype support set that, nonetheless, achieves strong language modeling performance. This is achieved by (1) imposing a sparsity-inducing prior on the prototype selection distribution, and (2) utilizing amortized variational inference to learn a prototype retrieval function. In experiments, our model outperforms previous prototype-driven language models while achieving up to a 1000x memory reduction, as well as a 1000x speed-up at test time. More interestingly, we show that the learned prototypes are able to capture semantics and syntax at different granularity as we vary the sparsity of prototype selection, and that certain sentence attributes can be controlled by specifying the prototype for generation.

研究の動機と目的

  • 推論時に訓練コーパス全体を格納・インデックス化する必要があるため、プロトタイプ駆動型テキスト生成モデルの非効率性に対処すること。
  • トレーニング中にヒューリスティック手法に依存するプロトタイプ選択を排除すること。これは最適でなく、微分不能である可能性がある。
  • 依然として強力な言語モデル性能を達成しつつ、最小限で影響力の高いプロトタイプ集合を自動で発見すること。
  • 異なる粒度で意味的・文法的構造を反映するプロトタイプを学習することで、解釈可能で制御可能なテキスト生成を可能にすること。
  • 特にリソースが限られた環境や高スループット要件がある状況において、生成品質を損なわずに推論時の効率を向上させること。

提案手法

  • 各文が、まず潜在的なスパースプロトタイプ分布からプロトタイプをサンプリングすることで生成される生成モデルを提案する。
  • プロトタイプ分布は対称ディリクレ事前分布としてモデル化され、スパース性を誘導し、推論時に必要なプロトタイプ数を削減する。
  • ヒューリスティック選択に代わって、入力シーケンスを関連するプロトタイプにマッピングする学習可能なプロトタイプ検索器を、アンモタイズド変分推論を用いて訓練する。
  • モデルは、選択されたプロトタイプに微分可能な編集ベクトルを適用することで最終出力を生成するニューラルエディタを使用する。
  • 変分下界を最適化することで、プロトタイプ分布と検索関数を同時に学習し、エンドツーエンドの訓練を可能にする。
  • 編集ベクトルはボーン・ミーゼス=フィッシャー事前分布からサンプリングされ、編集空間における球面補間を可能にし、滑らかな中間文の生成を可能にする。

実験結果

リサーチクエスチョン

  • RQ1非パラメトリックなテキスト生成モデルは、メモリ使用量と推論時間を著しく削減しながら、強力な言語モデル性能を達成できるか?
  • RQ2スパースリティを誘導する事前分布は、ヒューリスティック選択に依存せずに、最小限で効果的なプロトタイプ集合を自動で特定できるか?
  • RQ3学習されたプロトタイプは、スパースリティの異なるレベルで、意味的・文法的構造をどのように反映しているか?
  • RQ4プロトタイプや編集ベクトルを指定することで、制御可能なテキスト生成が可能か?
  • RQ5プロトタイプ検索にアンモタイズド変分推論を用いることで、ヒューリスティックベースのプロトタイプ選択を上回る性能が得られるか?

主な発見

  • 提案モデルは、従来のプロトタイプベースのモデルと比較して、最大1000倍のメモリ使用量削減と1000倍の高速化を達成した。
  • MSCOCOデータセットでは、ニューラル言語モデルベースラインと比較して1.4ポイント、以前のニューラルエディタモデルと比較して0.9ポイントのパープレキシティ低下を達成した。
  • Yelpデータセットでは、ニューラル言語モデルベースラインと比較して最大14ポイント、以前のニューラルエディタモデルと比較して6ポイントのパープレキシティ低下を達成した。
  • 778個のプロトタイプのみを用いても、同じ数のプロトタイプを用いたヒューリスティック事前クラスタリングベースラインと同等の性能(BLEUスコア17.2)を達成した。
  • 高いスパースリティ(α=0.1)では、プロトタイプは一般的な文法的・構造的パターンを捉えているが、スパースリティが低いと、より具体的な意味的コンテンツを反映している。
  • 編集ベクトル空間における球面線形補間により、滑らかにプロトタイプ間を遷移する自然な中間文が生成され、制御可能性が実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。