Skip to main content
QUICK REVIEW

[論文レビュー] MEGATRON-CNTRL: Controllable Story Generation with External Knowledge Using Large-Scale Language Models

Peng Xu, Mostofa Patwary|arXiv (Cornell University)|Oct 2, 2020
Topic Modeling参考文献 34被引用数 12
ひとこと要約

本稿では、キーワード駆動型の検索と文脈に基づくランク付けを統合することで、外部知識を統合する制御可能ストーリー生成フレームワーク、Megatron-Cntrlを提案する。124Mから8.3Bパラメータにスケーリングすることで、人間評価において一貫性93.0%、制御性91.5%を達成し、ROC Storyデータセットにおいて先行研究を上回る性能を示した。

ABSTRACT

Existing pre-trained large language models have shown unparalleled generative capabilities. However, they are not controllable. In this paper, we propose MEGATRON-CNTRL, a novel framework that uses large-scale language models and adds control to text generation by incorporating an external knowledge base. Our framework consists of a keyword predictor, a knowledge retriever, a contextual knowledge ranker, and a conditional text generator. As we do not have access to ground-truth supervision for the knowledge ranker, we make use of weak supervision from sentence embedding. The empirical results show that our model generates more fluent, consistent, and coherent stories with less repetition and higher diversity compared to prior work on the ROC story dataset. We showcase the controllability of our model by replacing the keywords used to generate stories and re-running the generation process. Human evaluation results show that 77.5% of these stories are successfully controlled by the new keywords. Furthermore, by scaling our model from 124 million to 8.3 billion parameters we demonstrate that larger models improve both the quality of generation (from 74.5% to 93.0% for consistency) and controllability (from 77.5% to 91.5%).

研究の動機と目的

  • ストーリー生成における大規模事前学習言語モデルの制御性の不足と知識統合の欠如に対処すること。
  • 文脈から導出される解釈可能なキーワードを用いて、動的で微細な制御を可能にすること。
  • マルチステージフレームワークを通じて関連する外部知識を統合することで、ストーリーの質を向上させること。
  • 大規模言語モデルのスケーリングが生成品質と制御性の両方を向上させることを示すこと。

提案手法

  • 現在の文脈に基づいて、次に来るストーリー文の解釈可能なキーワードを生成するキーワード予測モデルを用いる。
  • 予測されたキーワードを用いて、外部知識ベースから知識トリプルを検索する。
  • ストーリー文脈への関連性に基づいて、検索された知識をフィルタリングおよび再ランク付けする文脈的知識ランカーを適用する。
  • 正例ラベルが不要な弱い教師信号として、文の埋め込みを用いて知識ランカーを学習する。
  • 文脈と上位ランクの知識文を条件としてテキスト生成器を条件づけ、一貫性があり知識に基づいたストーリーの継続を生成する。
  • モデルサイズを124Mから8.3Bパラメータにスケーリングし、モデルサイズが品質および制御性に与える影響を調査する。

実験結果

リサーチクエスチョン

  • RQ1外部知識は、大規模言語モデルに効果的かつ動的に統合可能であり、ストーリー生成の質を向上させることができるか?
  • RQ2キーワードベースの制御は、一貫性と流暢さを維持しながら、どの程度ストーリー生成をガイドできるか?
  • RQ3モデルスケーリングは、生成されたストーリーの質と制御性の両方にどのように影響するか?
  • RQ4正例ラベルがなくとも、文の埋め込みからの弱い教師信号が文脈的知識ランカーの訓練に効果的に用いられるか?

主な発見

  • Megatron-Cntrlは、124Mパラメータで74.5%の一貫性を達成し、8.3Bパラメータで93.0%に向上した。
  • 人間評価では、キーワードをその対義語に置き換えた際、91.5%のストーリーが正常に制御された。
  • ROC Storyデータセットにおいて、先行最先端手法と比較して繰り返しを低減し、多様性を向上させた。
  • モデルスケーリングに伴い、制御性とストーリー品質の両方が顕著に向上し、サイズとパフォーマンスの強い相関が示された。
  • 文の埋め込みからの弱い教師信号で学習された文脈的知識ランカーは、ノイズの多い知識を効果的にフィルタリングし、関連性を向上させた。
  • 解釈可能なキーワードを用いた動的で微細な制御が可能であり、124Mパラメータで77.5%、8.3Bパラメータで91.5%のケースで対義語ベースの制御が成功した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。