Skip to main content
QUICK REVIEW

[論文レビュー] Topic-Preserving Synthetic News Generation: An Adversarial Deep Reinforcement Learning Approach

Ahmadreza Mosallanezhad, Kai Shu|arXiv (Cornell University)|Oct 30, 2020
Topic Modeling参考文献 36被引用数 8
ひとこと要約

本稿では、トピックの維持を保ちつつ検出不能なリアルなフェイクニュースを生成できる強化学習フレームワーク、RLTGを提案する。GPT-2の出力からトピック関連性と敵対的リアリズムを最大化する語を選択することで、フェイクニュース検出器を報酬信号として用い、検出を避けられる高品質なフェイクニュースを生成する。ROUGE-Lおよび検出精度という指標において、最先端のベースラインを上回った。

ABSTRACT

Nowadays, there exist powerful language models such as OpenAI's GPT-2 that can generate readable text and can be fine-tuned to generate text for a specific domain. Considering GPT-2, it cannot directly generate synthetic news with respect to a given topic and the output of the language model cannot be explicitly controlled. In this paper, we study the novel problem of topic-preserving synthetic news generation. We propose a novel deep reinforcement learning-based method to control the output of GPT-2 with respect to a given news topic. When generating text using GPT-2, by default, the most probable word is selected from the vocabulary. Instead of selecting the best word each time from GPT-2's output, an RL agent tries to select words that optimize the matching of a given topic. In addition, using a fake news detector as an adversary, we investigate generating realistic news using our proposed method. In this paper, we consider realistic news as news that cannot be easily detected by a fake news classifier. Experimental results demonstrate the effectiveness of the proposed framework on generating topic-preserving news content than state-of-the-art baselines.

研究の動機と目的

  • フェイクニュース分類器によって検出されにくく、かつトピックに忠実な合成ニュースを生成する課題に対処すること。
  • トピック関連性に向かって語の選択を誘導する強化学習エージェントを導入することで、GPT-2のような事前学習済み言語モデルからの制御されたテキスト生成を可能にすること。
  • 事前学習済み言語モデルを活用することで、学習から再訓練するのではなく、トレーニング時間とリソースの消費を削減すること。
  • フェイクニュース検出の向上のため、人間が書いたニュースと機械生成されたニュースの違いを調査すること。
  • 研究およびフェイクニュース対策の分野で利用可能な、スケーラブルで高速かつ制御可能な合成ニュース生成手法を開発すること。

提案手法

  • フレームワークは、各ステップで次の語の確率分布を生成するために事前学習済みGPT-2モデルを用いる。
  • 報酬関数がトピック関連性、文の自然さ、敵対的リアリズムをバランスさせるように、RLエージェントがGPT-2の出力確率分布から語を選択する。
  • 報酬関数は3つの要素を組み合わせる:訓練データとのコンテンツ重複度を測るROUGE-Lスコア、トピックエンコーダーによるトピック類似度、フェイクニュース分類器からの敵対的報酬。
  • エージェントは、シーケンス生成全体の累積報酬を最大化するために、深層Qネットワーク(DQN)を用いた強化学習で訓練される。
  • リアルタイムのフィードバックを提供するために、フェイクニュース分類器であるアドバーサリー・モジュールが使用され、分類器が容易に検出できないニュースの生成を促進する。
  • エージェントが一貫性があり、トピックに沿っており、リアルなニュースを生成できるように、カリキュラム学習戦略を用いてエンドツーエンドで微調整される。

実験結果

リサーチクエスチョン

  • RQ1強化学習エージェントは、与えられたトピックに忠実なまま、事前学習済み言語モデルを制御して合成ニュースを生成できるか?
  • RQ2フェイクニュース分類器を用いた敵対的訓練は、生成されたニュースのリアリズムを向上させることができるか?
  • RQ3本手法は、トピックの維持と検出回避という観点で、最先端のベースラインと比べてどのように差をつけるか?
  • RQ4報酬関数の異なる構成要素が、生成されたニュースの質と一貫性に与える影響は何か?
  • RQ5本フレームワークは、学習から再訓練するモデルよりも、高速に高品質な合成ニュースを生成できるか?

主な発見

  • RLTGフレームワークはテストセットでROUGE-Lスコア0.58を達成し、トピック維持性と自然さの面でベースライン手法を顕著に上回った。
  • 訓練済みのフェイクニュース分類器は、正答率81.3%、AUC75.3%を達成し、生成されたニュースがリアルで検出が難しいことを示した。
  • RLエージェントの平均報酬は時間経過とともに増加し、4,000回のトレーニングイテレーション以内に効果的な学習と収束が確認された。
  • パラメータ解析の結果、訓練データとの重複度を測るβ成分がROUGE-L性能に最も大きな影響を与えた。
  • モデルは1日未満で学習が完了し、学習から再訓練を要するGrover や GPT-2 と比べて著しく高速であった。
  • 人間による評価では、生成されたニュースが一貫したスタイルを持ち、内容が整合的で明確なトピックの焦点を持つことが確認され、70%のサンプルが人間アノテーターによって信頼できると評価された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。