Skip to main content
QUICK REVIEW

[論文レビュー] Improving Language Generation with Sentence Coherence Objective

Ruixiao Sun, Jie Yang|arXiv (Cornell University)|Sep 7, 2020
Topic Modeling参考文献 9被引用数 4
ひとこと要約

本稿では、GPT-2ベースの整合性分類器を訓練し、REINFORCEを用いた強化学習の目的関数で言語モデルを共同訓練することで、条件付きテキスト生成におけるトピック整合性を向上させる二段階手法を提案する。このアプローチは、長文生成におけるトピックのずれを顕著に低減するが、わずかに文の流れのなめらかさが低下するという代償を伴う。

ABSTRACT

Conditional story generation and contextual text continuation have become increasingly popular topics in NLP community. Existing models are often prone to output paragraphs of texts that gradually diverge from the given prompt. Although the generated text may have a reasonable perplexity and diversity, it could easily be identified by human as gibberish. The goal of our project is to improve the coherence and consistency across sentences in a language-generation model. We aim to solve this issue by first training a sentence pair coherence classifier with GPT-2 pretrained model, and then co-train the GPT-2 language model with this new coherence objective using a method analogous to the REINFORCE algorithm. This fine-tuned language model is able to generate lengthy paragraph conditioned on a given topic without diverging too much. The simplicity of this model allows it to be applicable to a variety of underlying language model architecture since it only modifies the final layer of the pre-trained model.

研究の動機と目的

  • 自己回帰的モデル(例:GPT-2)がプロンプトから徐々に逸脱する、条件付きテキスト生成におけるトピックのずれを是正すること。
  • 基盤となる言語モデルのアーキテクチャを変更せずに、生成されたテキストとプロンプトとの間の整合性を向上させること。
  • 事前学習モデルに強化学習を組み込むことのできる、トレーニング可能で軽量な整合性目的関数を開発すること。
  • 微調整された整合性目的関数が、文の流れの整合性を保ちながら長文生成の一貫性を向上させるかどうかを評価すること。

提案手法

  • GPT-2モデルを微調整し、段落に隣接する文のペアとランダムな文のペアを用いた二値分類タスクで文のペアの整合性を予測する。
  • 微調整済みGPT-2の[CLS]トークン表現を、整合性予測の文の埋め込みとして使用する。
  • 文の埋め込みの上に論理回帰ヘッドを追加し、2つの文が同じ段落に属するかどうかを予測する。
  • REINFORCEアルゴリズムを用いて、生成されたテキストとプロンプトとの間の整合性を最大化する目的関数を用いて、GPT-2言語モデルと共同で訓練する。
  • 2番目の訓練エポック以降に有効になる重み付き補助損失を導入し、学習の安定化を図る。
  • 生成過程で、分類器のスコアに従って次に予測される単語の選択をガイドすることで、整合性目的を適用する。

実験結果

リサーチクエスチョン

  • RQ1微調整済みGPT-2モデルは、文のペア間のトピック整合性を検出する有効な文の整合性分類器として機能するか?
  • RQ2REINFORCEで最適化された整合性目的関数を言語モデルと共同で訓練することで、長文条件付き生成におけるトピックのずれが低減するか?
  • RQ3整合性目的関数の導入は、標準的なGPT-2と比較して生成テキストの文の流れや自然さにどのような影響を及ぼすか?
  • RQ4整合性目的関数は、最小限のアーキテクチャ変更で、任意の事前学習済みトランスフォーマーモデルに適用可能か?
  • RQ5訓練スケジュール(例:整合性目的の遅延導入)が収束性と性能に与える影響は何か?

主な発見

  • 整合性分類器はテストセットで94.21%の正確度を達成し、人間水準の性能(92%)に近づき、クロスアテンションベースライン(94.52%)を上回った。
  • 共同訓練モデルは、ノイズの多い勾配にもかかわらず、REINFORCEアルゴリズムによる効果的な最適化が示された。整合性損失は時間経過とともに減少傾向を示した。
  • バリデーションセットにおけるパープレクシティは15に収束し、安定した言語モデル性能が得られた。
  • 共同訓練モデルから生成されたテキストは、標準的なGPT-2と比較して顕著に優れたトピックの一貫性を示し、長文にわたってプロンプトからの逸脱が減少した。
  • 線形射影よりも非線形変換が優れた性能を示し、線形射影では退化した繰り返しの出力が生じた。
  • 元のGPT-2と比較してわずかに文の流れや語彙選択、文法の自然さが低下したが、強固な整合性を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。