Skip to main content
QUICK REVIEW

[論文レビュー] Rethinking Exposure Bias In Language Modeling

Yifan Xu, Kening Zhang|arXiv (Cornell University)|Oct 13, 2019
Topic Modeling参考文献 24被引用数 6
ひとこと要約

本論文は、文完成タスクを用いた露出バイアスの評価パラダイムを提案し、マルチエントロピー採番とマルチレンジ強化を特徴とするMEMRフレームワークを導入することで、敵対的訓練の安定化を図っている。この手法は、文完成の質とコーパスBLEUスコアの両面で最先端の性能を達成し、露出バイアスの低減と未知のプレフィックスに対する耐性の向上を示している。

ABSTRACT

Exposure bias describes the phenomenon that a language model trained under the teacher forcing schema may perform poorly at the inference stage when its predictions are conditioned on its previous predictions unseen from the training corpus. Recently, several generative adversarial networks (GANs) and reinforcement learning (RL) methods have been introduced to alleviate this problem. Nonetheless, a common issue in RL and GANs training is the sparsity of reward signals. In this paper, we adopt two simple strategies, multi-range reinforcing, and multi-entropy sampling, to amplify and denoise the reward signal. Our model produces an improvement over competing models with regards to BLEU scores and road exam, a new metric we designed to measure the robustness against exposure bias in language models.

研究の動機と目的

  • ニューラル言語モデルにおける露出バイアスを測定する実用的で評価駆動のアプローチを確立すること。
  • テキスト生成における敵対的訓練の不安定性と収束不良を解消すること。
  • 教師強制入力ではなく、モデルが生成したプレフィックスに条件づけられたシーケンス生成におけるモデルの耐性を向上させること。
  • 推論時の分布シフトに対して耐性を保ちながら、高品質な生成を実現することのバランスを取ること。
  • 改善された敵対的訓練が、同時に生成品質の向上と露出バイアス低減を達成できることを示すこと。

提案手法

  • 訓練分布からの真値プレフィックスを用いた文完成タスクを提案し、プレフィックス長が延長されるに従い性能低下を測定することで、露出バイアスの評価を行う。
  • 複数の温度設定(0.5 から 1.5)からサンプリングすることで、マルチエントロピー採番を導入し、敵対的訓練における探索性を向上させる。
  • 生成器の複数の中間層で評価者(クリティック)の監視を提供することで、マルチレンジ強化を採用し、より安定で情報豊富な報酬信号を実現する。
  • 生成器の訓練を複数の信頼度レベル([0, 0.2, 0.4, 0.6, 0.8])でガイドするため、5つのターゲット値を持つ評価者ネットワークを採用し、ポリシー更新の安定性を向上させる。
  • アクター・クリティック強化学習を、標準のLSTM生成器と8層のCNN識別器を組み合わせ、Adam最適化法で訓練する。
  • 生成品質と多様性を併合で評価するため、3種類のBLEU変種(前方BLEU(BLEU_F)、後方BLEU(BLEU_B)、調和平均BLEU(BLEU_HA))を採用する。

実験結果

リサーチクエスチョン

  • RQ1制御された真値プレフィックスを用いた文完成タスクにより、露出バイアスを効果的に測定できるか?
  • RQ2評価者ネットワークを用いた敵対的訓練は、モデルが生成したプレフィックスからシーケンスを生成する際のモデルの耐性にどのように影響するか?
  • RQ3マルチエントロピー採番とマルチレンジ強化は、ニューラル言語モデルにおける敵対的訓練の安定化に寄与するか?
  • RQ4教師強制法や従来のGANベース手法と比較して、提案手法MEMRは、長く未知のプレフィックスにおける性能低下をどの程度低減できるか?
  • RQ5改善された敵対的訓練は、コーパスBLEUと文完成指標で測定される生成品質と多様性のトレードオフをどのように改善するか?

主な発見

  • MEMRモデルはテストセットにおいて文完成BLEU-F4スコア27.9 ± 0.07を達成し、SeqGAN(21.0 ± 0.11)やRankGAN(22.3 ± 0.11)を顕著に上回り、露出バイアスに対する優れた耐性を示している。
  • EMNLP2017 WMTニュースデータセットでは、MEMRが31.6 ± 0.06のコーパスBLEUスコアを達成し、すべての比較モデル(LeakGAN:31.6 ± 0.04、RankGAN:30.1 ± 0.06)を上回った。
  • MEMRモデルは、プレフィックス長が延びるに従い、特に未知のテストデータにおいて、文完成精度の低下が最も穏やかで、露出バイアスの低減が確認された。
  • 教師強制法(TF)とスケジュールドサンプリング(SS)で訓練されたモデルは、短いプレフィックスでは優れた性能を示したが、より長い未知のプレフィックスでは急激なスコア低下を示し、高い露出バイアスが判明した。
  • SeqGAN や RankGAN などのGANベースのモデルは、初期精度が低かったが、評価者監視のおかげでより安定した性能低下を示し、内在的な耐性が確認された。
  • MEMRの調和平均BLEU(BLEU_HA)18.4 ± 0.03というスコアは、品質と多様性の両面でバランスの取れた改善を示しており、モード崩壊の回避を裏付けている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。