Skip to main content
QUICK REVIEW

[論文レビュー] Reducing Non-Normative Text Generation from Language Models

Xiangyu Peng, Siyan Li|arXiv (Cornell University)|Jan 23, 2020
Topic Modeling被引用数 7
ひとこと要約

本稿では、正規性テキスト分類器を報酬信号として用いる方策勾配強化学習アプローチを提案し、5つのデータセットで非正規性テキスト生成を27–61%削減する。この手法は、正規性コーパスの再トレーニングを大規模に必要とせず、社会的に適切な出力をモデルが指向するように導く。

ABSTRACT

Large-scale, transformer-based language models such as GPT-2 are pretrained on diverse corpora scraped from the internet. Consequently, they are prone to generating non-normative text (i.e. in violation of social norms). We introduce a technique for fine-tuning GPT-2, using a policy gradient reinforcement learning technique and a normative text classifier to produce reward and punishment values. We evaluate our technique on five data sets using automated and human participant experiments. The normative text classifier is 81-90% accurate when compared to gold-standard human judgments of normative and non-normative generated text. Our normative fine-tuning technique is able to reduce non-normative text by 27-61%, depending on the data set.

研究の動機と目的

  • GPT-2のような大規模言語モデルが、インターネットからスクレイピングされた訓練データに起因する有害または逸脱した行動を反映することが多いことに対し、非正規性テキストの生成を低減すること。
  • 価値に整合した事前学習(具体的には正規性テキスト分類器)が、ファインチューニングにおける強化学習の非微分可能報酬関数として効果的であるかを検討すること。
  • 自動指標と人的評価を併用して、多様なデータセットにおけるこの手法の有効性を評価すること。
  • 感情や毒性検出などの他の分類タスクに対しても同様の手法を適用することで一般化の可能性を示すこと。
  • 有害な言語生成を制御するためのスケーラブルでデータ効率の良い代替手法として、大規模な再トレーニングやデータセットのバイアス除去に代わる選択肢を提供すること。

提案手法

  • 事前学習済みの正規性テキスト分類器を報酬信号として用いる方策勾配強化学習により、GPT-2をファインチューニングする。
  • Goofus & Gallantのコマicsから学習した正規性分類器が、生成されたテキストを「正規性あり」または「非正規性あり」と分類し、強化学習の報酬信号を提供する。
  • 報酬関数は非微分可能であるため、モデルの出力品質に基づいてバックプロパゲーションによる更新を方策勾配を用いて行う。
  • ROCStories、Plotto、サイレントフィクション物語などの複数のデータセットにこの手法を適用し、一般化性と有効性を評価する。
  • 正規性分類器を負の感情や有害言語分類モデルに置き換えることでアブレーションを実施し、異なる基準に対しても汎用性があることを示す。
  • 人的評価と自動指標を併用して、すべてのテストセットにおいて非正規性コンテンツの削減を検証する。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みの正規性テキスト分類器が、GPT-2における非正規性テキスト生成を低減する報酬関数として効果的に機能するか。
  • RQ2この強化学習ファインチューニング手法が、多様なテキスト生成タスクにおいて非正規性出力をどの程度低減できるか。
  • RQ3感情や毒性など他の基準で学習した分類器を用いても、この手法が一般化するか。
  • RQ4非正規性のベースラインレベルが異なるデータセットにおいて、この手法の性能はどのように変動するか。
  • RQ5この技術は、大規模なデータ再トレーニングやバイアス除去に代わるスケーラブルな代替手法として利用可能か。

主な発見

  • 提案手法によるファインチューニングにより、5つの評価データセットで非正規性テキスト生成が27–61%削減され、非正規性の高いデータセットでより顕著な削減が観察された。
  • 本研究で用いられた正規性テキスト分類器は、ゴールスタンダードの人間評価と比較して81–90%の正確性を達成した。
  • この手法は他の分類タスクにも一般化可能であり、負の感情や有害言語分類器を用いても有効性が確認された。
  • 人的評価により、ファインチューニング済みモデルが顕著に少ない非正規性の記述を生成することが確認され、自動指標の結果を裏付けた。
  • ラベル付きデータが限られた状況でも有効であることが示された。正規性分類器はGoofus & Gallantのコマicsから少数のサンプルで学習された。
  • このアプローチにより、大規模な再トレーニングを要せず、価値に整合した事前学習に基づいた生成方向へのアライメントを実現し、自己検閲行為を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。