Skip to main content
QUICK REVIEW

[論文レビュー] A Simple Contrastive Learning Objective for Alleviating Neural Text Degeneration

Shaojie Jiang, Ruqing Zhang|arXiv (Cornell University)|May 5, 2022
Topic Modeling被引用数 10
ひとこと要約

本論文は、トレーニング中に正例(真のラベル)トークンと負例(繰り返し)の候補を明示的に対比する対照的トークン(CT)学習目的を提案し、繰り返しを低減させることでテキスト生成品質を向上させている。この手法は交差エントロピーとアンリクレアビリティ目的を組み合わせており、最小限のパープレキシティコストで、言語モデルとオープンドメイン対話タスクの両方で繰り返し率を著しく低く抑え、最先端の結果を達成している。

ABSTRACT

The cross-entropy objective has proved to be an all-purpose training objective for autoregressive language models (LMs). However, without considering the penalization of problematic tokens, LMs trained using cross-entropy exhibit text degeneration. To address this, unlikelihood training has been proposed to reduce the probability of unlikely tokens predicted by LMs. But unlikelihood does not consider the relationship between the label tokens and unlikely token candidates, thus showing marginal improvements in degeneration. We propose a new contrastive token learning objective that inherits the advantages of cross-entropy and unlikelihood training and avoids their limitations. The key idea is to teach a LM to generate high probabilities for label tokens and low probabilities of negative candidates. Comprehensive experiments on language modeling and open-domain dialogue generation tasks show that the proposed contrastive token objective yields much less repetitive texts, with a higher generation quality than baseline approaches, achieving the new state-of-the-art performance on text degeneration.

研究の動機と目的

  • 自己回帰的言語モデルにおける一般的な失敗モードである、トークン、フレーズ、文の繰り返しを解消すること。
  • 交差エントロピーとアンリクレアビリティトレーニングの限界を克服し、語彙内の負例(繰り返し)と無関係なトークンを区別できない点を改善すること。
  • 正例(正しい)トークンと負例(繰り返し)の候補を明示的に対比する訓練目的を設計し、望ましくない繰り返しを抑制すること。
  • パープレキシティを維持またはわずかに増加させつつ、繰り返しを低減させることで生成品質を向上させること。
  • 言語モデリングとオープンドメイン対話生成タスクの両方で、テキスト劣化に関する最先端のパフォーマンスを達成すること。

提案手法

  • CT目的は、真の(正例)トークンの確率を最大化し、負例候補の確率を最小化する対照的損失として定義される。
  • 負例候補は、シーケンスの直前のM個のトークンとして選ばれ、繰り返しパターンを表す。
  • CT目的を標準の交差エントロピー損失と組み合わせることで、言語モデリング能力を維持しながら劣化を低減する。
  • 自己回帰的生成プロセス中に両目的を用いてエンドツーエンドでモデルを訓練する。
  • CT目的は各デコードステップに適用され、真の次トークンをM個の最近接トークン(負例として)と対比する。
  • 文脈的に関連する負例候補に限定することで、無関係なトークンを励起するのを避け、ノイズを低減し、繰り返しの抑制を向上させる。

実験結果

リサーチクエスチョン

  • RQ1正例と負例トークンを明示的に対比する対照的学習目的は、交差エントロピーまたはアンリクレアビリティトレーニングよりも、テキスト劣化をより効果的に低減できるか?
  • RQ2全過去トークンではなく、最近接の文脈トークンを負例候補として使用することで、繰り返し抑制が向上するか?
  • RQ3CT目的は、パープレキシティをほとんど上昇させずに、自己回帰的テキスト生成における繰り返しを著しく低減できるか?
  • RQ4対話および言語モデリングタスクにおける自動評価および人間評価指標において、CT目的は既存手法と比較してどのように差をつけるか?
  • RQ5負例候補選択のシーケンス長およびウインドウサイズが、生成品質および繰り返し率に与える影響は何か?

主な発見

  • 言語モデリングタスクでは、CT目的はグリーディーモードでrep-1率9.19、ビームサーチで6.89を達成し、UL-TSやNCEを含むすべてのベースラインより顕著に低い値を記録した。
  • オープンドメイン対話タスクでは、CTはグリーディーモードでrep-1率0.60、ビームサーチで0.64を記録し、すべての手法の中で最も低い繰り返し率と最高の多様性を達成した。
  • 言語モデリングタスクでは、CTがrep-4率をグリーディーモードで0.05、ビームサーチで0.12まで低減し、アンリクレアビリティベースの手法を含むすべてのベースラインを上回った。
  • 人間評価では、CTが生成した応答はUL-TSや他のベースラインと比較して繰り返しが少なく、より整合性があり、対話タスクでの人間の好みスコアが0.64を記録した。
  • パープレキシティがわずかに上昇(ベースライン比+1.44ポイント)したものの、多様性と整合性の大幅な向上により、CTは全体的な生成品質が最良であった。
  • アブレーションスタディにより、全過去トークンではなく、M個の最近接トークンのみを負例候補として使用することで、性能が向上し、ノイズが低減することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。