Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning Based Text Style Transfer without Parallel Training Corpus

Hongyu Gong, Suma Bhat|arXiv (Cornell University)|Mar 26, 2019
Topic Modeling参考文献 38被引用数 9
ひとこと要約

本論文は、並列学習コーパスを必要とせず、敵対的スタイル識別、ワードムーバーズディスタンス(WMD)による意味的類似度、および言語モデルによる流暢さ評価を組み合わせたジェネレータ・エバリュエーターフレームワークを用いた強化学習ベースのテキストスタイル変換モデルを提案する。この手法は、エンドツーエンドの強化学習最適化と多様な評価指標を用いることで、コンテンツの保持、スタイル転送の強さ、および流暢さの面で、感情やフォーマルさの転送タスクにおいて最先端の性能を達成した。

ABSTRACT

Text style transfer rephrases a text from a source style (e.g., informal) to a target style (e.g., formal) while keeping its original meaning. Despite the success existing works have achieved using a parallel corpus for the two styles, transferring text style has proven significantly more challenging when there is no parallel training corpus. In this paper, we address this challenge by using a reinforcement-learning-based generator-evaluator architecture. Our generator employs an attention-based encoder-decoder to transfer a sentence from the source style to the target style. Our evaluator is an adversarially trained style discriminator with semantic and syntactic constraints that score the generated sentence for style, meaning preservation, and fluency. Experimental results on two different style transfer tasks (sentiment transfer and formality transfer) show that our model outperforms state-of-the-art approaches. Furthermore, we perform a manual evaluation that demonstrates the effectiveness of the proposed method using subjective metrics of generated text quality.

研究の動機と目的

  • 並列学習コーパスが利用できない状況におけるテキストスタイル変換の課題に対処すること。
  • 微分可能な損失関数に依存せずに、コンテンツ保持、スタイル転送の強さ、および流暢さを向上させること。
  • 意味的類似度や流暢さといった非微分可能な評価指標を、強化学習を用いて訓練目的に効果的に統合できることを実証すること。
  • 複数の制約モジュール(スタイル、意味的類似度、流暢さ)を統合した柔軟なフレームワークを構築すること。

提案手法

  • ジェネレータは、入力文を元のスタイルから目的のスタイルに変換するアテンションベースのシーケンス・ツー・シーケンスモデルである。
  • エバリュエータは3つの構成要素からなる:敵対的に訓練されたスタイル識別器(目的スタイルの文を識別)、意味的類似度を測定するワードムーバーズディスタンス(WMD)モジュール、および文の文法的・構文的品質をスコアリングする言語モデル。
  • 強化学習により、エバリュエータのスコアから得られる報酬を用いてジェネレータを更新することで、非微分可能な指標を用いた最適化が可能になる。
  • スタイル識別器は、実際の目的スタイルの文と生成された文を区別するように敵対的に訓練され、スタイル分類の堅牢性と正確性が向上する。
  • 意味的保持はWMDによって強制され、並列データを必要とせずに、元の文と生成された文の意味的類似度を計算する。
  • 流暢さは、事前に訓練された言語モデルを用いて、生成された文の文法的・構文的品質をスコアリングすることで評価される。

実験結果

リサーチクエスチョン

  • RQ1並列学習コーパスにアクセスできない状況でも、強化学習フレームワークが効果的にテキストスタイル変換を実行できるか?
  • RQ2並列例が利用できない状況でも、意味的コンテンツをどれほど効果的に保持しつつスタイル転送が可能か?
  • RQ3意味的類似度や言語モデルスコアといった非微分可能な評価指標を、スタイル変換の訓練目的に効果的に統合できるか?
  • RQ4本手法は、コンテンツ保持、転送強度、および流暢さの観点から、従来の手法と比較してどのように優れているか?

主な発見

  • 感情転送タスクにおいて、提案手法はコンテンツ保持とスタイル転送強度のバランスを最良に保ち、クロスアテンション(CA)およびマルチデコーダーseq2seq(MDS)ベースラインを上回る総合スコアを達成した。
  • フォーマルさ転送タスクにおいて、モデルは最高の総合スコアと最小のパープレキシティを達成し、コンテンツ保持、転送強度、および流暢さの面で優れた性能を示した。
  • 非公式から公式への転送方向は、逆方向よりも著しく困難であり、非公式なテキストに多様性や綴りの誤りが多いためと推察される。
  • 手動評価により、モデルが生成した文は、コンテンツ類似度、スタイル転送強度、および流暢さの点で高く評価され、6段階スケールで平均スコアが4.5以上であった。
  • モデルは、語彙置換、語の削除、語の挿入、構造的変更といった多様なリライト戦略を効果的に適用し、スタイル変換を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。