Skip to main content
QUICK REVIEW

[論文レビュー] Select and Attend: Towards Controllable Content Selection in Text Generation

Xiaoyu Shen, Jun Suzuki|arXiv (Cornell University)|Sep 10, 2019
Topic Modeling参考文献 63被引用数 4
ひとこと要約

本論文は、ニューラルエンコーダーデコーダーモデルにおけるコンテンツ選択とテキスト生成を分離する変分推論に基づくフレームワークを提案する。これにより、何が述べられるかについて明示的かつ人間が理解可能な制御が可能になる。コンテンツ選択を潜在変数として扱い、微分可能下界を用いてエンドツーエンドで訓練することで、モデルはコンテンツレベルの多様性と制御性に優れ、性能と制御性のトレードオフを調整するための単一のハイパーパrameterで制御可能である。データからテキストへの変換およびヘッドライン生成タスクにおいて、最先端のベースラインを上回る性能を発揮する。

ABSTRACT

Many text generation tasks naturally contain two steps: content selection and surface realization. Current neural encoder-decoder models conflate both steps into a black-box architecture. As a result, the content to be described in the text cannot be explicitly controlled. This paper tackles this problem by decoupling content selection from the decoder. The decoupled content selection is human interpretable, whose value can be manually manipulated to control the content of generated text. The model can be trained end-to-end without human annotations by maximizing a lower bound of the marginal likelihood. We further propose an effective way to trade-off between performance and controllability with a single adjustable hyperparameter. In both data-to-text and headline generation tasks, our model achieves promising results, paving the way for controllable content selection in text generation.

研究の動機と目的

  • エンドツーエンドのニューラルテキスト生成モデルにおいて、コンテンツ選択と表面的実現が混同されることによる制御性と解釈可能性の欠如に対処すること。
  • デコーダーからコンテンツ選択を分離し、ユーザーによる制御が明示的かつ解釈可能になるようにすること。
  • 人間がアノテートしたコンテンツ選択が不要なエンドツーエンド学習を可能にするために、周辺尤度の下界を最大化すること。
  • 生成性能とコンテンツ制御性のトレードオフを効果的に制御するための単一で調整可能なハイパーパrameterを提供すること。
  • データからテキストへの変換やヘッドライン生成を含む多様なテキスト生成タスクにおいて、フレームワークの有効性を実証すること。

提案手法

  • コンテンツ選択を潜在変数として扱い、アモルタイズド変分推論を用いてセレクタとジェネレータを同時に訓練する。
  • 周辺尤度の微分可能下界を用いることで、人間がアノテートしたコンテンツラベルが不要なエンドツーエンド学習を可能にする。
  • セレクタと生成テキスト間の条件付き相互情報量(CMI)の上界を制約するためのハイパーパrameter ε を導入する。
  • 変分オートエンコーダー風の目的関数を用いてモデルを訓練し、後方分布近似をバックプロパゲーションにより最適化する。
  • コンテンツセレクタをデコーダーの前段に、微分可能でアテンションベースのモジュールとして挿入し、ソース表現に注目してソーストークンのソフトマスクを出力可能にする。
  • 訓練中に ε を調整することで、生成品質(低いNLL)とコンテンツレベルの多様性/制御性(高いエントロピー)のバランスを制御する。

実験結果

リサーチクエスチョン

  • RQ1ニューラルテキスト生成における表面的実現からコンテンツ選択を分離することで、明示的かつ人間が理解可能な制御が可能になるか?
  • RQ2人間がアノテートしたコンテンツ選択が不要な、微分可能でエンドツーエンドの学習目的関数を設計できるか?
  • RQ3生成性能とコンテンツ制御性のトレードオフを単一のハイパーパrameterで効果的に調整できるか?
  • RQ4提案手法は、既存のベースラインと比較してより高いコンテンツレベルの多様性と制御性を達成できるか?
  • RQ5本手法は、データからテキストへの変換やヘッドライン生成といった実世界のテキスト生成タスクにおいて、優れた性能を発揮するか?

主な発見

  • VRSモデルは、データからテキストへの変換およびヘッドライン生成タスクの両方で最先端の性能を達成しており、Wikibioではわずかな性能低下、Gigawordではより顕著な低下を示しているが、後者は不確実性の高いデータに起因するとされる。
  • ハイパーパrameter ε を大きくすることで、セレクタのエントロピーが向上し、コンテンツレベルの多様性と制御性が向上するが、NLL(性能)はわずかに低下する。
  • ε = 0 に設定した場合、すべてのソーストークンを保持する標準的なseq2seqモデルを上回る性能を示しており、明示的な制御性がなくてもコンテンツ選択が依然として有益であることが示された。
  • VRSモデルは、ベースラインと比較して選択されたコンテンツに忠実なテキストを生成する。VRSの生成物は常に選択された語を反映しているが、SS、Bo.Up、RSモデルはしばしば選択されたコンテンツを省略または誤解して表現する。
  • 図3は、VRSのサンプルが互いに非常に一貫しており、語の選択(例:'sparks uproar' と 'sparks protests')の違いを除き、ほとんど同一の意味を保持していることを示しており、強いコンテンツ忠実性とパラフレーズの多様性を示している。
  • モデルは、性能を維持しながら制御可能なコンテンツ選択を実現しており、図2に示すように、ε を用いた性能と制御性のトレードオフが効果的に調整可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。