Skip to main content
QUICK REVIEW

[論文レビュー] Self-Adversarial Learning with Comparative Discrimination for Text Generation

Wangchunshu Zhou, Tao Ge|arXiv (Cornell University)|Jan 31, 2020
Topic Modeling参考文献 25被引用数 11
ひとこと要約

本稿では、テキスト生成のための新しいGANフレームワークである自己対抗学習(SAL)を提案する。SALは、標準の二値識別器の代わりに比較的識別器を採用し、生成器に自己改善に基づく報酬を提供する。具体的には、現在の出力を過去の生成物と比較して、より優れていると判断された場合に報酬が与えられる。生成器が自身の過去のサンプルに対して改善を遂げた際に、密集した情報性の高い報酬を受け取ることで、報酬の疎らさとモード崩壊を著しく軽減し、ベンチマークデータセット上でのテキストの質と多様性が向上する。

ABSTRACT

Conventional Generative Adversarial Networks (GANs) for text generation tend to have issues of reward sparsity and mode collapse that affect the quality and diversity of generated samples. To address the issues, we propose a novel self-adversarial learning (SAL) paradigm for improving GANs' performance in text generation. In contrast to standard GANs that use a binary classifier as its discriminator to predict whether a sample is real or generated, SAL employs a comparative discriminator which is a pairwise classifier for comparing the text quality between a pair of samples. During training, SAL rewards the generator when its currently generated sentence is found to be better than its previously generated samples. This self-improvement reward mechanism allows the model to receive credits more easily and avoid collapsing towards the limited number of real samples, which not only helps alleviate the reward sparsity issue but also reduces the risk of mode collapse. Experiments on text generation benchmark datasets show that our proposed approach substantially improves both the quality and the diversity, and yields more stable performance compared to the previous GANs for text generation.

研究の動機と目的

  • 高品質で多様なテキスト生成を妨げる報酬の疎らさとモード崩壊を解消すること。
  • 自己改善報酬機構を導入することで、敵対的テキスト生成における訓練の安定性と性能を向上させること。
  • 識別器のコアな学習信号として、標準の二値分類をペairワイズ比較に置き換えること。
  • 比較学習と自己対戦ダイナミクスの有効性をテキスト生成において評価すること。
  • 既存のGANベースのテキスト生成手法と比較して、質と多様性の両面で優れた性能を示すこと。

提案手法

  • 生成器が現在の出力が以前に生成されたサンプルよりも優れていると判断された場合に報酬が与えられる自己対抗学習(SAL)パラダイムを導入する。
  • 2つの生成文のペアを「より良い」「より悪い」「ほぼ同等」という3クラスに分類する比較的識別器を採用する。
  • ポリシー勾配アルゴリズムを用い、自己クリティックベースラインを導入し、報酬を現在の出力と過去の生成物の間の比較スコアとする。
  • 深層強化学習のスケジューリング報酬とメモリリプレイ技術を応用し、訓練を安定化させる。
  • 識別器が「本物/偽物」のラベルではなく、相対的な品質を評価する最小最大化目的で生成器を訓練する。
  • AlphaGoにインspiredされた自己対戦ダイナミクスを活用し、時間経過とともに継続的な改善を促進する。

実験結果

リサーチクエスチョン

  • RQ1生成されたサンプル間の相対的品質を評価する比較的識別器が、テキストGANにおける訓練の安定性を向上させられるか。
  • RQ2自己改善報酬機構が報酬の疎らさを軽減し、学習信号の密度を向上させられるか。
  • RQ3自己対抗学習は、標準GANと比較して、どれほどモード崩壊を緩和できるか。
  • RQ4比較的識別器に「ほぼ同等」クラスを含めることで性能にどのような影響があるか。
  • RQ5提案手法は、既存のGANベースのテキスト生成アプローチと比較して、より優れた質と多様性を達成できるか。

主な発見

  • COCOデータセットでは、SALは231.3 ± 10.8のパープレキシティを達成し、CAL(276.7 ± 12.5)や他のアブレーションバリアントを顕著に上回った。
  • 合成データでは、SALはNLLが14.29 ± 0.11にまで低下し、次善のベースライン(14.65 ± 0.16)を著しく下回った。
  • アブレーションスタディの結果、『≈』クラスを削除すると性能が最も著しく低下し、安定した比較基準としての重要性が示された。
  • スケジューリング報酬なし、およびメモリリプレイなしのアブレーションでは性能低下が確認されたが、これはこれらの訓練技術の価値を裏付けるものであり、コアなコンポONENTSほど重要度は低くなかった。
  • 比較的識別器のみ(CAL)でも、標準GANを上回る性能を示し、比較による学習が有効であることを実証した。
  • SALはより安定した訓練と優れた一般化性能を示し、他の手法と比較して実行間の分散が低かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。